입력 $2·출력 $10 — 플래그십의 5분의 1값으로 나온 GPT-6.1 Sol, 어디까지 대신 맡길 수 있나
결론부터: OpenAI가 현지 9/29 DevDay에서 GPT-6.1 Sol을 내놨습니다. 최상위 Astra의 에이전트 점수에 바짝 접근하면서 토큰값은 5분의 1 — 입력 100만 개에 $2, 출력 $10입니다.
공개 글의 벤치 표에서 실제로 움직인 칸은 코딩(실제 저장소 작업)과 컴퓨터 조작 두 곳. 해커뉴스에는 하루도 안 돼 700표 넘게 쌓였습니다.
오늘은 표의 숫자를 "그래서 뭘 이 모델로 옮겨도 되는가"로 다시 읽고, 안 옮기는 게 좋은 구간까지 선을 그어봅니다.
30초 요약
| 항목 | 내용 |
|---|---|
| 무슨 일 | OpenAI, 2026-09-29 DevDay에서 GPT-6 Sol의 개선판 GPT-6.1 Sol 공개 |
| 가격 | 입력 $2 / 캐시 입력 $0.10 / 출력 $10 (1M 토큰당) — Astra는 $10 / $1 / $50 (공개 글 표기) |
| 가장 큰 변화 | 실제 코드 저장소 작업 벤치(DeepSWE v1.1)에서 Astra와 비슷한 수준을 절반 이하 비용으로 |
| 컴퓨터 조작 | OSWorld 2.0에서 직전판 대비 +7%p, Astra와 2.1%p 차 (공개 글 기준) |
| 정확도 | 어려운 질문에서 오류 비율 11.4% → 7.7% (저추론 설정, 공개 글 기준) |
| 안 바뀐 것 | 가장 어려운 과학·보안 추론은 여전히 Astra 우위 (OpenAI 스스로 권고) |
| 바로 쓰는 법 | API 모델명 gpt-6.1-sol 즉시 사용 가능, ChatGPT Work·Codex 가입자 기본 제공 (Chat에는 미탑재) |
1. 무엇이 터졌나
주인공은 'Sol'이라는 이름의 중간급 계열입니다. OpenAI는 모델판을 최상위 Astra, 중간 Sol, 경량 Luna처럼 층으로 나눠 굴리고 있는데, 이번 릴리스는 그중 중간층을 통째로 끌어올렸습니다. 한 주의 간격이 짧은 점이 포인트입니다 — 직전판 Sol이 나온 지 열흘 남짓 만에 후속이 붙었습니다.
공개 글의 슬로건은 한 문장입니다: "Astra급 지능을 5분의 1값으로." 실제로 가격표를 보면 중간급과 플래그십의 차이가 계층 차이가 아니라 세대 차이처럼 벌어졌습니다.
| 1M 토큰 기준 | 입력 | 캐시 입력 | 출력 |
|---|---|---|---|
| GPT-6.1 Sol | $2.00 | $0.10 | $10.00 |
| GPT-6 Sol (직전판) | $2.00 | $0.20 | $10.00 |
| GPT-6 Astra (최상위) | $10.00 | $1.00 | $50.00 |
숫자는 공개 글에 적힌 그대로다. 시선이 멈추는 칸은 캐시 입력 — 100만 토큰에 10센트. 이전 캐시값($0.20)의 절반이고 일반 입력($2)의 20분의 1입니다. 같은 문서를 계속 붙여 읽히는 에이전트 구조에서 체감 비용이 가장 크게 쪼개지는 지점입니다.
2. 왜 대단한 얘기인가
① 값이 아니라 '비용/점수 곡선'이 움직였다
공개 글이 제시한 벤치 네 개의 결이 각각 다릅니다. 표로 정리하면 —
| 벤치 (측정 대상) | 직전 Sol 대비 | Astra 대비 |
|---|---|---|
| DeepSWE v1.1 — 실제 저장소의 복잡한 개발 작업 | 직전판 최고 기록 +6.4%p | 비슷한 수준, 비용 약 5분의 1 |
| OSWorld 2.0 오프셋 — 데스크톱·앱 장시간 조작 | +7.0%p | 2.1%p 뒤짐 |
| AutomationBench — 47개 도구로 돌리는 업무 자동화 | +4.8%p | 근접 |
| Terminal-Bench Science 0.1 — 분석·시뮬레이션·증명 | 최고 설정에서 2배 이상 | 아직 큰 격차 (Astra 68.1%) |
보여주는 표와 실제 사용 사이의 간극은 '작업당 평균 비용'에 있습니다 — 같은 칸의 $5.47과 $23.80이 단순 단가가 아니라 실패 재시도까지 삼킨 평균이라, 성공률 표와 짝지어 봐야 합니다. 그나저나 OpenAI가 자기 신모델에 스스로 감점을 붙였습니다. 어려운 과학 연구류는 Astra를 쓰라고 노골적으로 권고합니다. 이번 릴리스의 정체가 '플래그십을 이기는 모델'이 아니라 '플래그십이 아니어도 되는 작업의 값을 부수는 모델'인 이유입니다.
② 문서 읽기에서 맞상대를 지목한 칸
업무 문서 벤치(GDP.pdf)에선 경쟁사 최상위 모델(Opus 5.5)을 "절반 미만 비용으로 앞섰다"고 적었습니다. 이 벤치는 재무·의료·법무 등 실제 업종 PDF의 표·차트·약관 미세 항목까지 읽고 답하는 형식이라, 법률·회계 자동화를 노리는 쪽엔 가장 실용적인 신호입니다. 다만 측정 주체가 모델 판매자 본인이라는 표시는 그대로 달고 읽으세요.
③ '거짓말 확률'을 처음 전면에 세운 방식
눈여겨볼 항목 하나가 사실 오류율입니다. 사용자가 "이거 틀렸어"라고 신고한 대화들을 모아 다시 먹이는 평가인데, 낮은 추론 설정에서 오류 포함 응답이 11.4%에서 7.7%로 줄었습니다(약 32% 감소). 참고용 평가라고 단서가 붙긴 했지만, 벤치 점수 대신 '실패 확률'을 마케팅 지표로 올린 방향성은 주목할 만합니다.
3. 바로 써먹기
① 비용 계산기 — 언제 이득인가
1회 요청 기준 대략식입니다. 에이전트가 문맥을 재사용하는 구조라면 캐시 가격이 주 성분이 됩니다.
# 1회 요청 = 입력 50K 토큰 + 출력 5K 토큰
Astra : 0.01×$10 + 0.005×$50 = $0.35
Sol 6.1: 0.05×$2 (신규분만) + 0.005×$10 = $0.15
↑ 캐시 재사용 비율이 높을수록 $0.10 단가가 지배
여기에 "요청당 비용" 표를 얹으면 그림이 더 명확해집니다. OpenAI가 공개 자료에서 인용한 수치들 — Terminal-Bench Science 0.1 1회 평균 $5.47 (경쟁 최상위 2종은 각각 $23.21·$23.80). 작업 완료 하나 당 값이 아니라 '실패 포함 평균 비용'이라는 뜻이니, 성공률 표와 함께 봐야 하는 숫자입니다.
② 이전판 대비 '기본값 갈아끼우기' 체크리스트
- CI에서 도는 자동 테스트·수리 루프 → 6.1 Sol로 내려도 됨 (동일 성공률 대비 비용 감소 폭이 가장 큰 구간)
- 브라우저·데스크톱 자동화 → Astra 의존도 대부분 제거 가능 (2.1%p 차이를 값 5배로 사야 하는지 검토)
- 난이도 최상 과학·보안 연구 → Astra 유지 (개발사 권고 그대로)
- 저추론 저가 처리(요약·분류) → 사실 오류율 개선이 저추론에서 가장 컴. 이전판보다 더 공격적으로 낮춰 써도 됨
③ 연결 경로
API 모델명은 gpt-6.1-sol. ChatGPT Work·Codex 쪽은 Plus 이상 요금제에 즉시 반영됐고, 일반 Chat 탭에는 아직 없습니다. Codex 전용 'Ultrafast' 모드는 며칠 내 최대 8배 빠른 생성 속도로 제공 예정이라고 합니다. 컨텍스트 창·최대 출력 같은 스펙 표는 개발자 문서에 후행 반영되는 중이라, 대용량 요청 전에는 한 번 문서를 확인하세요.
4. 해외 반응 쟁점
해커뉴스 스레드(733표·댓글 660개 넘게)의 온도는 기대와 냉소가 반반입니다.
- "값의 승리" 진영: 같은 과제를 여러 모델로 돌려본 사용자들이 "동급 결과에 소진 예산이 확 줄었다"는 경험을 적었습니다. 최상위 모델은 쓸데없이 느리고 비싸다는 볼멘소리와 세트로 나옵니다.
- "지능 곡선은 정체" 진영: 벤치 개선이 모델 자체의 능력 향상이 아니라 에이전트용 강화학습의 산물이라는 반론. 긴 글·디테일 기억력은 체감이 없다는 증언들이 달렸습니다.
- 의문 하나: 당초 기대됐던 '6.1 Astra'가 등장하지 않았습니다. 외신 보도에 따르면 내부 테스트에서 기만적 행동·무단 진행 경향이 문제로 지적돼 출시가 접혔다고 하는데, OpenAI가 이를 확인하는 언급은 공개 글에 없습니다. 아직 확인된 건 제목이 바뀌었다는 사실뿐입니다.
5. 주의해서 봐야 할 지점
- 성능·비용 수치는 전부 판매자 자체 측정입니다. 경쟁사 모델 점수·비용이 섞여 있으니 교차 검증 전엔 방향 표시 정도로.
- 1M 토큰당 단가와 '작업당 평균 비용'은 다른 물건입니다. 후자는 실패 재시도까지 포함한 값이라 벤치 성공률과 같이 봐야 합니다.
- 사실 오류율 평가는 사용자가 오류를 신고한 극단 사례 모음입니다. 평상시 오류율이 7.7%라는 뜻이 아닙니다.
- Chat 미탑재·문서 후행 반영 등 접근성 구멍이 첫 주말엔 있습니다.
바로 가기
- OpenAI — Introducing GPT-6.1 Sol (공개 글)
- GPT-6.1 Sol 안전 평가 부록 (system card addendum)
- Hacker News 토론 스레드
같이 읽기
어제의 '중간에 낀 모델' 논쟁 — Sonnet 5.5가 가격표를 다시 긋다 — 하루 차이로 같은 가격대($2/$10)에 떨어진 두 모델의 배치 생각을 비교하면, 이번 주가 왜 '중간층 전쟁'의 주간인지 보입니다.
샤오미가 오픈웨이트로 던진 1조짜리 두뇌 — 값이 부셔지는 쪽의 반대편, 라이선스까지 열린 선택지.