카테고리
Qwen3-4B Thinking
-

DeepMath가 수학 풀이를 짧고 안전하게 바꾼 방식
huggingface.co의 「DeepMath: A lightweight math reasoning Agent with smolagents」를 바탕으로, Qwen3-4B Thinking과 GRPO가 수학 추론을 어떻게 바꿨는지 정리합니다. 출력 길이는 최대 66% 줄었습니다.
카테고리

huggingface.co의 「DeepMath: A lightweight math reasoning Agent with smolagents」를 바탕으로, Qwen3-4B Thinking과 GRPO가 수학 추론을 어떻게 바꿨는지 정리합니다. 출력 길이는 최대 66% 줄었습니다.