카테고리
RESEARCH
새로운 연구와 논문
-

PipelineRL이 대규모 RL의 지연을 줄인 방식
PipelineRL이 추론 처리량과 정책 일치 데이터 수집의 충돌을 실행 중 가중치 갱신으로 줄인 방식을 정리합니다. 7B 실험은 2개 노드에서 ~3.5일이었고, 배치 크기 4096·학습률 1e-6·최대 생성 토큰 수 8192를 같은 설정으로 썼습니다.
-

하네스 설정 두 개가 ARC-AGI-3 점수를 바꿨다
OpenAI가 공개한 ARC-AGI-3 분석을 바탕으로, GPT-5.6 Sol의 점수가 7.8%에서 38.3%로 달라진 이유를 정리합니다. 하네스 설정, 유지된 추론, 175,000 문맥 한계, 출력 토큰 6x 감소, 공개 집합 수치도 함께 읽습니다.
-

Lean 증명에서 92.2%를 만든 TTRL 검색
huggingface.co의 Kimina-Prover 글을 바탕으로 miniF2F-test에서 pass@1 63.9, pass@32 84.0, 최종 92.2%가 나온 구조와 오류 수정·lemma 재사용의 실무 포인트를 정리합니다.
-

SmolLM3가 3B급에서 앞선 이유
Hugging Face가 공개한 SmolLM3의 핵심을 정리합니다. 3B 모델이 Llama-3.2-3B와 Qwen2.5-3B를 앞선 이유, 128k 문맥, 384 H100, 24일 학습 수치와 GQA·NoPE의 역할을 함께 봅니다.
-

주피터 노트북을 작은 모델 학습 데이터로 바꾼 이유
huggingface.co의 Jupyter Agents 글을 바탕으로 DABStep에서 Claude 4 Sonnet이 20%에도 못 미친 이유, 44.4%→59.7% 개선, 2TB→250GB 정제 과정을 정리합니다. 작은 모델과 노트북 기반 에이전트의 병목을 실무 기준으로 봅니다.
-

Lean 4 정리 증명 학습 파이프라인을 공개했습니다
Hugging Face의 Kimina-Prover-RL이 공개한 Lean 4 정리 증명 학습 파이프라인을 정리합니다. 1.7B 모델의 76.63% Pass@32와 0.6B 모델의 의미, 그리고 검증 흐름 점검 포인트를 함께 봅니다.
-

DeepMath가 수학 풀이를 짧고 안전하게 바꾼 방식
huggingface.co의 「DeepMath: A lightweight math reasoning Agent with smolagents」를 바탕으로, Qwen3-4B Thinking과 GRPO가 수학 추론을 어떻게 바꿨는지 정리합니다. 출력 길이는 최대 66% 줄었습니다.