샤오미가 오픈웨이트로 던진 1조짜리 두뇌 — 150명 넘게 "좋아요" 찍은 모델 2종

발행 2026-09-22 · 분류 AI 실전편 · 난이도 중급 · 읽는 시간 6분

결론부터: 어제(현지 9/21) 샤오미가 자기 AI 모델 두 종을 MIT 라이선스로 통째 공개했습니다. 파라미터 최대 1조급짜리이고, 텍스트·이미지·영상·오디오를 한 모델에서 처리합니다.

HackerNews에는 공개 하루 만에 390표 넘게 밀려 올라왔고, 모델 페이지 두 개에는 이틀 남짓한 시간에 270명 넘는 개발자가 "좋아요"를 찍었습니다.

오늘은 수치 표의 뼈대만 떼어다 "한국 1인 개발자가 오늘 당장 이걸 어디에 쓸 수 있나"까지 따라드립니다.

30초 요약

항목내용
무슨 일샤오미 MiMo 팀이 V2.6 계열 2종(Pro·Flash)을 HuggingFace·ModelScope에 공개 (2026-09-21)
크기Pro 1.02T(활성 42B) / Flash 309B(활성 15B) — 모두 희소 MoE
라이선스MIT — 상업 이용·파인튜닝·재배포 제한 없음 (모델 카드 표기 기준)
입력텍스트·이미지·영상·오디오 통합, 컨텍스트 창 100만 토큰
눈길 끈 수치Flash가 자체 공개 벤치에서 GPT-5.6 Sol·Claude Opus 5급 에이전트 점수 (벤치·주체 모두 샤오미)
바로 쓰는 법OpenRouter에 샤오미 직접 호스팅으로 이미 올라 있음 — Flash 입력 $0.14·출력 $0.28/1M 토큰 (9/22 페이지 표기)
주의성능 수치는 전부 제조사 자체 측정. 한국어를 포함한 다국어 평가는 아직 공개 표에 없음

1. 무엇이 터졌나

샤오미는 스마트폰 회사라는 상표 때문에 더 화젭니다. 2026년 9월 21일(UTC) HuggingFace에 올라온 모델 두 개의 이름은 MiMo-V2.6-Pro-RLMiMo-V2.6-Flash-RL. 모델 카드가 처음 내세운 문장은 "강화학습을 자기개선 쪽으로 확장한다"는 것 하나였습니다.

설계 방향은 명확합니다. 학습을 도메인별로 따로 돌리는 대신 코딩·범용 에이전트·비전·보안 학습을 한 배치에 섞어 돌렸습니다. 한 번의 강화학습 통과로 여러 능력을 서로 부풀리겠다는 계산입니다. 학습 규모로 카드에 적힌 숫자는 단계당 프롬프트 1,568개에 롤아웃 16배 — 한 번 갱신에 수십억 토큰을 태운다는 설명입니다.

성공 판정을 이진 통과/실패로만 내리면 통과 답들끼리 우열을 가릴 수 없다는 문제의식도 깔렸습니다. 그래서 같은 그룹의 답들을 비교하는 평가 에이전트를 따로 세워, 점수가 같은 답 사이에서도 "더 짧은 경로, 더 적은 토큰" 쪽으로 상을 기울이게 했습니다.

모델 크기는 두 갈래입니다. Pro는 총 1.02조·한 번 계산에 깨우는 파라미터 420억, Flash는 총 309B·활성 15B의 MoE 구조입니다. 컨텍스트는 두 종 모두 100만 토큰. 입력은 텍스트에 이미지·영상·오디오를 기본기로 붙였고, 추론 속도를 끌어올리는 5단 계측 예측 디코더까지 포함됐습니다.

2. 왜 대단한 얘기인가

① "1조짜리를 MIT로"라는 조합

오픈웨이트 진영에서 이 규모는 드뭅니다. 게다가 라이선스가 MIT입니다 — 상업 이용, 파인튜닝, 재배포에 조건이 없습니다. 모델 호스팅 사업자 입장에선 법률 검토 없이 당장 서비스 메뉴에 올릴 수 있다는 뜻이고, 실제로 공개 직후 커뮤니티의 첫 질문도 "어디 호스팅에 올라가나"였습니다.

② 벤치 표에서 보인 그림

모델 카드가 공개한 표 기준으로 Flash 한 종이 제조사 간판급 상용 모델들과 같은 줄에 놓였습니다. 자체 벤치를 제외한 교차 검증 지점에서만 훑으면 이렇습니다.

공개 벤치 (모델 카드 표기)Flash비교 상용 모델들
AutomationBench (자동화 에이전트)52.3Claude Opus 5 50.3 / GPT-5.6 Sol 45.8
Toolathlon-Verified (도구 호출)73.6Opus 5 80.6 / Sol 74.9
Terminal Bench 2.1 (터미널 작업)87.6Opus 5 89.1 / Sol 88.8
OSWorld-Verified (데스크톱 조작)80.8Opus 5 83.4 / Sol 83.0
JobBench (직무 작업)61.2Opus 5 65.7 / Sol 45.4

여기서 정직하게 선을 그으면 — 이 표의 측정 주체가 샤오미 자신이라는 점입니다. 경쟁사 모델을 자기 기준으로 재단한 숫자이고, 특히 Pro 쪽 수치는 비교군 대비 "자체 벤치 우위"로 칠 먹기 좋은 위치에 있습니다. 그래서 커뮤니티도 표 자체보다 "오픈웨이트로 이 규모가 나왔다는 사실" 자체를 더 크게 샀습니다.

③ 학습 과정을 공개한 방식

가벼운 화제 거리가 하나 더 있었습니다. 샤오미는 이 계열의 학습 진행 상황을 웹 대시보드에 실시간으로 띄워 놓는 실험을 이전 릴리스부터 이어오고 있습니다. 이번에도 공개 전날까지 대시보드 글이 HackerNews 앞쪽에 올라 550표 가까이를 모았습니다.

3. 바로 써먹기

① 설치 없이 맛보기 — OpenRouter·공식 API

모델 카드는 OpenRouter와 MiMo 오픈 플랫폼 API, MiMo 코드·데스크톱 앱을 정식 제공 경로로 적었습니다. 실제로 9/22 지금 OpenRouter에는 샤오미가 직접 호스팅하는 두 판이 떠 있습니다. 표기 가격만 옮겨 적으면 — Flash 입력 $0.14·출력 $0.28(1M 토큰 기준), Pro는 $0.435·$0.87. 한 가지 웃긴 장면: OpenRouter 쪽 "이 모델을 쓰는 공개 앱" 순위 1위에 코딩 에이전트 Claude Code가 올라 있습니다. 경쟁사 도구를 쓰던 사용자가 이 모델로 갈아타고 있다는 뜻이니, 벤치 표보다 이 한 줄이 화제성을 더 잘 설명합니다.

② 내 장비에서 — 양자화본이 이미 도는 중

309B를 통째로 올릴 장비는 대부분 없다 보니, 지역 커뮤니티는 양자화 판에 먼저 반응했습니다. HuggingFace에는 9B 증류판의 MLX 6bit·4bit 판이 공개 다음 날 올라와 있습니다. Mac의 통합 메모리에 얹는 계열입니다. 100만 컨텍스트는 원본 모델 표기 기준이고, 로컬 양자화본에서 어디까지 살아남는지는 각 판의 고지를 확인해야 합니다.

③ 배포 레시피는 공식으로

서버 배포는 vLLM과 SGLang 쪽에 레시피가 공지됐습니다. 카드 예시에서 핵심 인자만 골라 다시 쓰면 — Flash 판 하나를 4-way 분할로 띄우고, 외부 코드 실행을 허용하고, VRAM을 95%까지 쓰라는 조합입니다 (원문 예시 코드).

# 모델 경로: XiaomiMiMo/MiMo-V2.6-Flash-RL
vllm serve <경로> \
  --tensor-parallel-size 4 \
  --gpu-memory-utilization 0.95 \
  --trust-remote-code

권장 샘플링은 temperature 1.0, top_p 0.95. 권장 추론 엔진을 따라야 벤치 표와 같은 동작이라는 단서가 붙어 있습니다.

④ 어떤 일에 얹어볼까

작업이 모델이 밀리는 이유대신 걸림돌
창고 전체 읽기·리팩터 에이전트100만 토큰 창 + 긴 도구 기록을 한 세션에활성 15B라도 총 309B — 서빙 장비가 필요
문서 스캔·녹취 요약 같은 복합 입력이미지·영상·오디오가 한 모델 안한국어 OCR·음성 품질 공개 평가 없음
경량 자체 호스팅 챗봇MIT라 상용 서비스 편입 자유양자화 판은 제조사 검증을 거치지 않은 3자 산출물
한 줄 요약 — 벤치 점수표가 아니라 "1조급 두뇌를 제한 없는 라이선스로, 오모달로, 1M 창으로"라는 조합이 샤오미가 던진 카드다.

4. 해외 반응 쟁점

"차트를 안 속였다"는 평가. HackerNews 댓글에서 가장 눈에 띈 반응은 오히려 반대편 공격이었습니다. 중국계 실험실이 벤치 표를 얼마나 자유자재로 편집하는지 지친 개발자들이, 이번 표는 경쟁사 수치를 불리하게 쓰지 않았다는 점 자체를 칭찬했습니다. 다만 "광고 재능이 실력만큼 올라왔다"는 냉소도 같은 자리에 있었습니다.

투명성 논쟁. 오픈웨이트의 진짜 기준(학습 데이터·코드 공개)을 들이밀며 "이건 오픈이 아니다"라고 깎는 댓글과, 학습 과정 공개 자체를 진보로 봐야 한다는 댓글이 붙었습니다. 어느 쪽이 이기느냐보다, 이런 기준 논쟁이 매 릴리스마다 반복되는 게 오픈웨이트 생태계의 현재 온도입니다.

메모리 계급 논쟁. 공유 메모리 128GB로 버티는 개인 개발자층이 "또 아슬아슬하게 안 돌아가는 크기"라며 한숨을 쉰 댓글창이 특히 공감을 모았습니다. 총 309B와 활성 15B를 구분해 "양자화하면 9B 판으로 되는 거 아니냐"는 계산이 오갔고, 증류판은 실제로 이틀 만에 나왔습니다.

속도표는 아직이다. 공개 이틀 차라 독립 서빙 사업자 기준 처리량·지연 수치가 아직 없습니다. "벤치 1위"보다 "내 돈 100원당 몇 토큰"이 정해지는 건 1~2주 뒤 커뮤니티 측 벤치라는 게 중론입니다.

5. 마시기 전 주의

바로 가기

같이 마시면 좋은 잔
"기본값은 기기 안"이라는 개발자 1,900명의 주장 — 1조급을 내 장비로 돌릴 수 있을까를 다시 보게 만드는 잔.
AI 실전편 시리즈 — 해외에서 검증된 워크플로만 골라 따라 하기 단계까지.
도구 코너 — 내 PC로 도는 AI 모델 체크 (준비 중).