OpenAI GPT OSS가 보여준 공개 모델 기준

핵심 요약

OpenAI는 GPT OSS를 추론, 에이전트 작업, 개발자 활용용 공개 가중치 모델군으로 냈습니다.

모델은 gpt-oss-120b와 gpt-oss-20b 두 개입니다.

대형 모델은 단일 H100 GPU에, 소형 모델은 16GB 메모리 안에 들어갑니다.

huggingface.co의 「Welcome GPT OSS, the new open-source model family from OpenAI!」는 OpenAI의 새 공개 모델군을 정리합니다. 원문은 두 모델의 크기, 양자화 방식, 배포 가능 범위를 함께 제시합니다. 핵심은 공개와 가벼운 배포를 같이 강조했다는 점입니다.

OpenAI는 GPT OSS를 어떤 용도의 모델군으로 제시했나

원문은 GPT OSS를 추론, 에이전트 작업, 개발자 활용을 위한 공개 가중치 출시라고 설명합니다. 한국어로 옮기면, 추론, 에이전트 작업, 개발자 활용을 겨냥한 공개 모델군입니다. huggingface.co는 이 모델을 Hugging Face의 Inference Providers에서 바로 호출하는 예시도 보여줍니다.

원문이 보여주는 배포 경로는 두 갈래입니다. 하나는 원격 추론입니다. 다른 하나는 transformers를 통한 로컬 추론입니다.

이 구성은 모델 공개의 의미를 단순 다운로드 이상으로 넓혀 줍니다.

두 모델의 용도와 배포 경로를 한눈에 보여주는 비교 도해
두 모델의 용도와 배포 경로를 한눈에 보여주는 비교 도해

gpt-oss-120b와 gpt-oss-20b는 무엇이 다르나

원문은 GPT OSS가 두 모델로 구성된다고 밝힙니다. 아래 표는 원문에서 확인된 값만 정리한 것입니다.

항목 원문 값 무엇을 재는 값인가
큰 모델 이름 gpt-oss-120b 대형 모델 식별자입니다.
큰 모델 파라미터 수 117B 모델 전체 규모를 뜻합니다.
작은 모델 이름 gpt-oss-20b 소형 모델 식별자입니다.
작은 모델 파라미터 수 21B 모델 전체 규모를 뜻합니다.
구조 전문가 혼합 구조 여러 전문가를 섞어 쓰는 구조를 뜻합니다.
양자화 방식 4비트 양자화(MXFP4) 가중치를 4비트로 줄이는 방식을 뜻합니다.
대형 모델 배치 조건 single H100 GPU 한 장의 H100에서 올릴 수 있음을 뜻합니다.
소형 모델 배치 조건 16GB 메모리 16GB 메모리 안에서 동작함을 뜻합니다.

It comprises two models: a big one with 117B parameters ( gpt-oss-120b ), and a smaller one with 21B parameters ( gpt-oss-20b ).

The large model fits on a single H100 GPU, while the small one runs within 16GB of memory

이 인용문은 모델군의 크기와 배치 경계를 직접 보여 줍니다. 숫자는 단순한 사양이 아니라, 어디까지 내려가서 돌릴 수 있는지를 말합니다.

117B·21B 파라미터와 단일 H100·16GB 배치 조건을 대응시키는 구조 도해
117B·21B 파라미터와 단일 H100·16GB 배치 조건을 대응시키는 구조 도해

공개 모델인데도 왜 작은 장비를 노렸나

원문은 전문가 혼합 구조와 4비트 MXFP4 양자화를 함께 둡니다. 이 조합은 활성 파라미터를 줄여 추론 비용을 낮추는 방향입니다. 따라서 공개 모델이라도 큰 서버만 전제하지 않습니다.

많은 사람은 공개 모델을 보면 큰 클러스터를 먼저 떠올립니다. 하지만 원문은 다른 그림을 제시합니다. 대형 모델도 단일 H100 GPU에 들어갑니다.

소형 모델은 16GB 메모리 범위에 맞춥니다. 즉, 공개의 목표가 연구용 저장소 공개에만 있지 않습니다. 실제로 돌릴 수 있는 폭을 넓히는 데도 있습니다.

원문은 이 모델군을 추론 전용 텍스트 모델로 소개합니다. 또한 도구 사용과 지시 따르기를 지원한다고 밝힙니다. 이 점은 공개 모델 = 실험용이라는 통념과도 갈립니다.

실무 배포를 의식한 공개라는 뜻에 가깝습니다.

내 시스템에서 먼저 점검할 것은 무엇인가

가장 먼저 볼 항목은 모델 크기보다 메모리와 배치 경로입니다. 원문은 대형 모델과 소형 모델의 배치 조건을 다르게 제시합니다. 따라서 하나의 기준으로 모든 환경을 판단하면 안 됩니다.

1. 목표 하드웨어를 먼저 나눕니다

  • 단일 H100급 서버가 있는지 확인합니다.
  • 16GB급 메모리 환경인지 확인합니다.
  • 둘 다 아니면 외부 추론 경로를 검토합니다.

2. 양자화 지원 여부를 확인합니다

원문은 4비트 MXFP4를 전면에 둡니다. 따라서 런타임이 4비트 양자화를 제대로 다루는지 봐야 합니다. 지원이 약하면 같은 모델도 체감 비용이 달라집니다.

3. 원격 호출과 로컬 실행을 분리합니다

huggingface.co의 Inference Providers는 같은 코드 흐름으로 원격 추론을 붙이게 합니다. 반면 로컬 실행은 transformers와 메모리 제약을 함께 봐야 합니다. 이 둘을 분리하면 배포 판단이 빨라집니다.

내일 바로 바꿀 점은 복잡하지 않습니다. 모델 이름보다 배치 조건을 먼저 적으십시오. 그다음 메모리, 추론 경로, 도구 사용 필요성을 순서대로 점검하십시오.

자주 묻는 질문

Q. GPT OSS는 몇 개 모델로 나왔습니까?
A. GPT OSS는 두 개 모델로 나왔습니다. 원문은 gpt-oss-120b와 gpt-oss-20b를 제시합니다.

Q. gpt-oss-120b는 어디에 올릴 수 있습니까?
A. 원문은 gpt-oss-120b가 단일 H100 GPU에 들어간다고 밝힙니다.

Q. gpt-oss-20b는 작은 장비에서도 쓸 수 있습니까?
A. 원문은 gpt-oss-20b가 16GB 메모리 안에서 동작한다고 설명합니다.

원문: 「Welcome GPT OSS, the new open-source model family from OpenAI!」

함께 읽기