입력 $2·출력 $10 — 플래그십의 5분의 1값으로 나온 GPT-6.1 Sol, 어디까지 대신 맡길 수 있나

GPT-6.1 Sol 히어로 — 가격표 막대 비교와 벤치 요약, 다크 네온 테마, 테크한잔

발행 2026-09-30 · 분류 AI 실전편 · 난이도 중급 · 읽는 시간 6분

결론부터: OpenAI가 현지 9/29 DevDay에서 GPT-6.1 Sol을 내놨습니다. 최상위 Astra의 에이전트 점수에 바짝 접근하면서 토큰값은 5분의 1 — 입력 100만 개에 $2, 출력 $10입니다.

공개 글의 벤치 표에서 실제로 움직인 칸은 코딩(실제 저장소 작업)과 컴퓨터 조작 두 곳. 해커뉴스에는 하루도 안 돼 700표 넘게 쌓였습니다.

오늘은 표의 숫자를 "그래서 뭘 이 모델로 옮겨도 되는가"로 다시 읽고, 안 옮기는 게 좋은 구간까지 선을 그어봅니다.

30초 요약

항목내용
무슨 일OpenAI, 2026-09-29 DevDay에서 GPT-6 Sol의 개선판 GPT-6.1 Sol 공개
가격입력 $2 / 캐시 입력 $0.10 / 출력 $10 (1M 토큰당) — Astra는 $10 / $1 / $50 (공개 글 표기)
가장 큰 변화실제 코드 저장소 작업 벤치(DeepSWE v1.1)에서 Astra와 비슷한 수준을 절반 이하 비용으로
컴퓨터 조작OSWorld 2.0에서 직전판 대비 +7%p, Astra와 2.1%p 차 (공개 글 기준)
정확도어려운 질문에서 오류 비율 11.4% → 7.7% (저추론 설정, 공개 글 기준)
안 바뀐 것가장 어려운 과학·보안 추론은 여전히 Astra 우위 (OpenAI 스스로 권고)
바로 쓰는 법API 모델명 gpt-6.1-sol 즉시 사용 가능, ChatGPT Work·Codex 가입자 기본 제공 (Chat에는 미탑재)

1. 무엇이 터졌나

주인공은 'Sol'이라는 이름의 중간급 계열입니다. OpenAI는 모델판을 최상위 Astra, 중간 Sol, 경량 Luna처럼 층으로 나눠 굴리고 있는데, 이번 릴리스는 그중 중간층을 통째로 끌어올렸습니다. 한 주의 간격이 짧은 점이 포인트입니다 — 직전판 Sol이 나온 지 열흘 남짓 만에 후속이 붙었습니다.

공개 글의 슬로건은 한 문장입니다: "Astra급 지능을 5분의 1값으로." 실제로 가격표를 보면 중간급과 플래그십의 차이가 계층 차이가 아니라 세대 차이처럼 벌어졌습니다.

1M 토큰 기준입력캐시 입력출력
GPT-6.1 Sol$2.00$0.10$10.00
GPT-6 Sol (직전판)$2.00$0.20$10.00
GPT-6 Astra (최상위)$10.00$1.00$50.00

숫자는 공개 글에 적힌 그대로다. 시선이 멈추는 칸은 캐시 입력 — 100만 토큰에 10센트. 이전 캐시값($0.20)의 절반이고 일반 입력($2)의 20분의 1입니다. 같은 문서를 계속 붙여 읽히는 에이전트 구조에서 체감 비용이 가장 크게 쪼개지는 지점입니다.

2. 왜 대단한 얘기인가

① 값이 아니라 '비용/점수 곡선'이 움직였다

공개 글이 제시한 벤치 네 개의 결이 각각 다릅니다. 표로 정리하면 —

벤치 (측정 대상)직전 Sol 대비Astra 대비
DeepSWE v1.1 — 실제 저장소의 복잡한 개발 작업직전판 최고 기록 +6.4%p비슷한 수준, 비용 약 5분의 1
OSWorld 2.0 오프셋 — 데스크톱·앱 장시간 조작+7.0%p2.1%p 뒤짐
AutomationBench — 47개 도구로 돌리는 업무 자동화+4.8%p근접
Terminal-Bench Science 0.1 — 분석·시뮬레이션·증명최고 설정에서 2배 이상아직 큰 격차 (Astra 68.1%)

보여주는 표와 실제 사용 사이의 간극은 '작업당 평균 비용'에 있습니다 — 같은 칸의 $5.47과 $23.80이 단순 단가가 아니라 실패 재시도까지 삼킨 평균이라, 성공률 표와 짝지어 봐야 합니다. 그나저나 OpenAI가 자기 신모델에 스스로 감점을 붙였습니다. 어려운 과학 연구류는 Astra를 쓰라고 노골적으로 권고합니다. 이번 릴리스의 정체가 '플래그십을 이기는 모델'이 아니라 '플래그십이 아니어도 되는 작업의 값을 부수는 모델'인 이유입니다.

② 문서 읽기에서 맞상대를 지목한 칸

업무 문서 벤치(GDP.pdf)에선 경쟁사 최상위 모델(Opus 5.5)을 "절반 미만 비용으로 앞섰다"고 적었습니다. 이 벤치는 재무·의료·법무 등 실제 업종 PDF의 표·차트·약관 미세 항목까지 읽고 답하는 형식이라, 법률·회계 자동화를 노리는 쪽엔 가장 실용적인 신호입니다. 다만 측정 주체가 모델 판매자 본인이라는 표시는 그대로 달고 읽으세요.

③ '거짓말 확률'을 처음 전면에 세운 방식

눈여겨볼 항목 하나가 사실 오류율입니다. 사용자가 "이거 틀렸어"라고 신고한 대화들을 모아 다시 먹이는 평가인데, 낮은 추론 설정에서 오류 포함 응답이 11.4%에서 7.7%로 줄었습니다(약 32% 감소). 참고용 평가라고 단서가 붙긴 했지만, 벤치 점수 대신 '실패 확률'을 마케팅 지표로 올린 방향성은 주목할 만합니다.

3. 바로 써먹기

① 비용 계산기 — 언제 이득인가

1회 요청 기준 대략식입니다. 에이전트가 문맥을 재사용하는 구조라면 캐시 가격이 주 성분이 됩니다.

# 1회 요청 = 입력 50K 토큰 + 출력 5K 토큰
Astra  : 0.01×$10 + 0.005×$50 = $0.35
Sol 6.1: 0.05×$2  (신규분만) + 0.005×$10 = $0.15
         ↑ 캐시 재사용 비율이 높을수록 $0.10 단가가 지배

여기에 "요청당 비용" 표를 얹으면 그림이 더 명확해집니다. OpenAI가 공개 자료에서 인용한 수치들 — Terminal-Bench Science 0.1 1회 평균 $5.47 (경쟁 최상위 2종은 각각 $23.21·$23.80). 작업 완료 하나 당 값이 아니라 '실패 포함 평균 비용'이라는 뜻이니, 성공률 표와 함께 봐야 하는 숫자입니다.

② 이전판 대비 '기본값 갈아끼우기' 체크리스트

③ 연결 경로

API 모델명은 gpt-6.1-sol. ChatGPT Work·Codex 쪽은 Plus 이상 요금제에 즉시 반영됐고, 일반 Chat 탭에는 아직 없습니다. Codex 전용 'Ultrafast' 모드는 며칠 내 최대 8배 빠른 생성 속도로 제공 예정이라고 합니다. 컨텍스트 창·최대 출력 같은 스펙 표는 개발자 문서에 후행 반영되는 중이라, 대용량 요청 전에는 한 번 문서를 확인하세요.

4. 해외 반응 쟁점

해커뉴스 스레드(733표·댓글 660개 넘게)의 온도는 기대와 냉소가 반반입니다.

5. 주의해서 봐야 할 지점

바로 가기

같이 읽기

어제의 '중간에 낀 모델' 논쟁 — Sonnet 5.5가 가격표를 다시 긋다 — 하루 차이로 같은 가격대($2/$10)에 떨어진 두 모델의 배치 생각을 비교하면, 이번 주가 왜 '중간층 전쟁'의 주간인지 보입니다.

샤오미가 오픈웨이트로 던진 1조짜리 두뇌 — 값이 부셔지는 쪽의 반대편, 라이선스까지 열린 선택지.