TL;DR
latent.space의 2026-07-24자 뉴스 묶음은 FLUX 3, The Stack v3, Qwen-Audio-3.0-TTS, Etched, 오스트리아 정부 플랫폼을 함께 다룹니다.
The Stack v3는 114 TB raw data, 224M repositories, 44B files, 770 languages, roughly 5T deduplicated/filtered tokens를 제시합니다.
실무에서는 모델 성능만 보지 말고 데이터 배포 방식, 제어 태그, 실제 배포 단위를 함께 봐야 합니다.
latent.space의 「[AINews] Black Forest Labs FLUX 3 – Multimodal Flow Models that beat Seedance 2.0, Gemini Omni and Grok Imagine, and FLUX-mimic video-action robotics model」는 2026-07-24에 공개된 뉴스 묶음입니다. 이 글은 그 묶음에서 원문이 실제로 밝힌 내용만 추려 분석합니다.
latent.space가 한 호에 묶은 발표는 다중모달, 공개 코드, 음성, 투자, 배포였습니다
latent.space는 같은 호에서 여러 발표를 함께 다뤘습니다. 핵심은 서로 다른 분야가 따로 움직이지 않았다는 점입니다.
Black Forest Labs는 FLUX 3를 소개했습니다. 원문은 이를 이미지, 비디오, 오디오, 행동 예측을 아우르는 하나의 다중모달 모델로 설명합니다. FLUX 3 Video는 초기 접근으로 공개됐습니다.
원문은 또 FLUX-mimic도 함께 소개했습니다. 이 모델은 로봇에서 돌아가며, mimicrobotics와 함께 개발됐습니다.
같은 호에서는 The Stack v3도 다뤘습니다. 이 데이터셋은 공개 코드 데이터의 규모를 다시 키운 사례로 제시됐습니다.
음성 쪽에서는 Qwen-Audio-3.0-TTS가 등장했습니다. 원문은 이 모델이 Flash와 Plus 변형으로 나왔다고 밝힙니다.
산업과 공공 배포도 함께 언급됐습니다. Etched의 자금 조달과 시설 확장, 그리고 오스트리아 정부 AI 플랫폼의 대상 규모가 그 예입니다.

The Stack v3와 Qwen-Audio-3.0-TTS의 수치는 이렇게 정리됩니다
아래 표는 원문에서 확인된 값만 정리한 것입니다. 각 값이 무엇을 재는지도 함께 적었습니다.
| 대상 | 원문 수치 | 무엇을 재는 값인지 |
|---|---|---|
| The Stack v3 | 114 TB 원시 데이터 | 수집된 코드 데이터의 총량입니다. |
| The Stack v3 | 224M 저장소 | 포함된 저장소 수입니다. |
| The Stack v3 | 44B 파일 | 포함된 파일 수입니다. |
| The Stack v3 | 770 언어 | 지원하는 언어 범위입니다. |
| The Stack v3 | roughly 5T 중복 제거·필터링 토큰 | 학습에 쓰기 전 정제된 토큰 규모입니다. |
| Qwen-Audio-3.0-TTS | Flash and Plus 변형 | 모델이 둘로 나뉘어 제공됐다는 뜻입니다. |
| Qwen-Audio-3.0-TTS | 16 languages | 지원 언어 수입니다. |
| Qwen-Audio-3.0-TTS | inline control tags like [whisper] / [angry] | 발화 스타일을 지시하는 제어 태그입니다. |
| Qwen-Audio-3.0-TTS | up to 3-minute one-pass generation | 한 번에 생성할 수 있는 길이 상한입니다. |
| Etched | $300M Series C at a $10.3B valuation | 자금 조달 규모와 기업가치입니다. |
| Etched | 80,000 sq ft / 10 MW facility | 시설 면적과 전력 규모입니다. |
| Austria’s government AI platform | roughly 180,000 Austrian federal employees | 도입 대상 인원 규모입니다. |
수치만 놓고 보면 범위가 넓습니다. 데이터셋은 저장소와 파일, 언어 수까지 커졌습니다. 음성 합성은 언어와 제어 태그, 생성 길이로 확장됐습니다.
투자와 시설, 공공 배포는 실제 운영 단위까지 드러냈습니다.
이 호가 보여준 차이는 모델 크기보다 배포 방식입니다
이번 묶음은 단순한 성능 경쟁으로 읽기 어렵습니다. 원문이 보여주는 차이는 모델 자체보다 배포 방식에 있습니다.
The Stack v3는 더 큰 데이터셋이라는 말만으로 끝나지 않습니다. 원문은 내용물을 그대로 담아 배포하고, Software Heritage IDs 대신 내용을 넣는다고 설명합니다. 또한 2025년 8월까지의 GitHub 재수집을 포함합니다.
제한적 라이선스 코드는 제외했습니다. 학습용 분할과 전체 버킷도 따로 제공합니다.
FLUX 3도 같은 방향입니다. 이미지, 비디오, 오디오, 행동 예측을 하나의 아키텍처로 묶었습니다. 이 구조는 기능을 따로 붙이는 방식과 다릅니다.
처음부터 함께 학습한 뒤 확장할 수 있다는 점이 핵심입니다.
Qwen-Audio-3.0-TTS는 제어성을 강조합니다. 언어 수만 늘린 것이 아니라 [whisper], [angry] 같은 태그도 넣었습니다. 즉, 음성 생성이 단순 재생산을 넘어 연출 가능한 층으로 옮겨갔습니다.
Etched의 투자와 시설은 또 다른 신호입니다. 연구 발표만이 아니라 전력과 공간, 공급망을 전제로 한 움직임입니다. 오스트리아 정부 플랫폼의 180,000명 규모도 비슷합니다.
실험이 아니라 실제 사용자 수를 기준으로 움직입니다.

내일 점검할 항목은 데이터 출처, 제어 신호, 실제 대상입니다
실무에서 먼저 볼 것은 모델 이름보다 입력과 출력의 구조입니다. 원문은 그 구조를 바꾸는 발표를 여럿 보여줍니다.
- 코드 데이터를 다룬다면 저장소 ID만 받는지, 내용 자체를 받는지 확인합니다.
- 제한적 라이선스 코드가 제외되는지 확인합니다.
- 학습용 분할과 전체 버킷을 따로 두는지 확인합니다.
- 음성 시스템이라면 지원 언어 수와 태그형 제어 신호를 함께 평가합니다.
- 긴 단일 생성이 필요한지, 여러 구간으로 끊어야 하는지 먼저 정합니다.
- 다중모달 모델이라면 이미지, 비디오, 오디오, 행동 예측을 같은 검증 기준으로 보지 않습니다.
- 로봇과 공공 배포는 데모보다 실제 대상 수와 운영 규모를 먼저 봅니다.
이 관점은 발표를 읽는 순서도 바꿉니다. 데이터팀은 The Stack v3부터 봐야 합니다. 음성이나 인터랙션 팀은 Qwen-Audio-3.0-TTS부터 봐야 합니다.
로봇과 현장 배포 팀은 FLUX-mimic과 오스트리아 사례를 함께 봐야 합니다.
자주 묻는 질문
Q1. FLUX 3는 무엇이 새로웠습니까?
A. FLUX 3는 이미지, 비디오, 오디오, 행동 예측을 하나의 다중모달 구조에 묶었습니다. 원문은 FLUX 3 Video의 초기 접근도 함께 밝혔습니다.
Q2. The Stack v3에서 가장 눈에 띄는 수치는 무엇입니까?
A. 114 TB 원시 데이터와 roughly 5T 중복 제거·필터링 토큰입니다. 원문은 여기에 224M 저장소, 44B 파일, 770 언어도 함께 제시했습니다.
Q3. 실무자는 어느 발표를 먼저 봐야 합니까?
A. 데이터 파이프라인을 손보는 팀은 The Stack v3부터 봐야 합니다. 음성이나 로봇을 다루는 팀은 Qwen-Audio-3.0-TTS와 FLUX-mimic부터 봐야 합니다.
