카테고리
Kernels
-

gpt-oss가 보여준 transformers 최적화의 실전 단서
Hugging Face의 gpt-oss 최적화 글을 바탕으로 transformers의 커널 허브, MXFP4, Flash Attention 3를 정리합니다. torch.compile은 2–10× 향상을 언급합니다.
카테고리

Hugging Face의 gpt-oss 최적화 글을 바탕으로 transformers의 커널 허브, MXFP4, Flash Attention 3를 정리합니다. torch.compile은 2–10× 향상을 언급합니다.