카테고리
GRPO
-

PipelineRL이 대규모 RL의 지연을 줄인 방식
PipelineRL이 추론 처리량과 정책 일치 데이터 수집의 충돌을 실행 중 가중치 갱신으로 줄인 방식을 정리합니다. 7B 실험은 2개 노드에서 ~3.5일이었고, 배치 크기 4096·학습률 1e-6·최대 생성 토큰 수 8192를 같은 설정으로 썼습니다.
-

Lean 4 정리 증명 학습 파이프라인을 공개했습니다
Hugging Face의 Kimina-Prover-RL이 공개한 Lean 4 정리 증명 학습 파이프라인을 정리합니다. 1.7B 모델의 76.63% Pass@32와 0.6B 모델의 의미, 그리고 검증 흐름 점검 포인트를 함께 봅니다.
-

DeepMath가 수학 풀이를 짧고 안전하게 바꾼 방식
huggingface.co의 「DeepMath: A lightweight math reasoning Agent with smolagents」를 바탕으로, Qwen3-4B Thinking과 GRPO가 수학 추론을 어떻게 바꿨는지 정리합니다. 출력 길이는 최대 66% 줄었습니다.