125B 모델이 24GB 그래픽카드 한 장에 — 퀀팅의 아버지가 반격에 나섰다

발행 2026-09-23 · 분류 AI 실전편 · 난이도 중급 · 읽는 시간 6분

결론부터: "최신 대형 모델은 비싼 구름 API로만 쓸 수 있다"는 통념이 정면으로 흔들렸다. 양자화(퀀팅) 연구로 AI 업계에 이름을 남긴 팀 딧머스의 연구소가 지난주 '오픈소스 위크'를 열고, 1250억(125B)급 모델을 일반 데스크톱 그래픽카드 한 장(24GB)에서 돌리는 추론 프레임워크를 공개했다. 5500억(550B)급은 128GB 메모리의 맥북 한 대로 올라간다고 한다.

HackerNews에는 글이 올라온 지 반나절도 안 돼 92표와 댓글 45개가 붙었다. 다만 폭발 지점은 성능 수치가 아니라 "그래도 소프트웨어 엔지니어 수요는 그 어느 때보다 많다"는 한 문장이었다 — 댓글창 절반이 이 문장 하나를 놓고 싸웠다.

오늘은 공개된 도구가 실제로 무엇을 해주는지, 그리고 '내 장비로 최신폰 모델을 돌린다'는 말이 개인 개발자에게 어떤 의미인지 따라갑니다.

30초 요약

항목내용
무슨 일퀀팅 연구로 유명한 팀 딧머스 연구소(dlab)가 '오픈소스 위크' 개막, 추론 프레임워크·압축 기법·자율 리서치 시스템 등을 한꺼번에 공개 (원문 게시 2026-09-21, HackerNews 입소 9-23)
대표 수치125B급 모델을 24GB 단일 GPU에서 구동. 550B급은 AMD 스트릭스·엔비디아 DGX 스파크·128GB 맥북에서 구동 (원문 주장 기준)
속도35B급 모델을 1.5비트 양자화로 초당 약 450토큰 생성, 반정도(f16) 대비 메모리 약 90% 절감 (원문 주장 기준)
덤으로에이전트 세션 컨텍스트를 자동 압축하는 기법 — 저자는 자기 세션이 토큰 1억 개를 넘었고 비용이 절반가량 줄었다고 기록. 오프라인 자율 리서치 시스템은 상업 리서치 에이전트 대비 우위를 자체 벤치로 주장
HN 쟁점"개발자 수요는 그 시절보다 많다"는 서술에 상위 댓글이 진입·중급 개발자 실업 데이터를 들며 반발. "수요의 단위가 사람이 아니라 사람×AI 조합으로 이동 중"이 다수 의견

1. 무엇이 공개됐나

핵심은 추론 프레임워크 하나다. 모델 자체를 새로 만든 게 아니라, 이미 공개된 오픈웨이트 모델(큐웬·딥시크 계열)을 "아주 적은 비트"로 눌러서 일반 장비에 얹는 기술이다. 퀀팅은 딧머스가 10년 넘게 파온 영역이라, 업계는 "그가 또 1비트 아래로 내려갔다"는 식으로 받아들이는 분위기다.

함께 나온 것 중 실무자가 더 반길 만한 건 세션 압축 쪽이다. 에이전트와 오래 일하면 대화·로그·파일 목록이 쌓여 컨텍스트가 폭죽처럼 부풀는데, 이 프레임워크는 컨텍스트 길이를 자동 관리해서 긴 세션도 버티게 해준다고 한다. 저자 본인이 "내 에이전트 세션 몇 개는 토큰 1억 개를 지났다"고 썼고, 도입한 조직은 AI 총예산이 45% 줄었다는 사례도 함께 실었다.

2. 왜 대단한 얘기인가 — '돌릴 수 있는 사람'의 범위가 바뀐다

지금까지 최신폰 대형 모델은 두 갈래였다. 돈 내고 API를 쓰거나, 아니면 몇 천만 원짜리 장비를 사거나. 125B급이 24GB 카드 한 장에 들어온다는 건 후자의 하한선이 "게이밍 PC" 수준으로 내려온다는 뜻이다. 연구실이 아니라 개인 책상에서 프런티어급 모델을 갖고 실험하는 시나리오가 실제로 성립하기 시작한다.

다만 이건 '공개된 주장'이다. 벤치마크 표를 공개한 게 아니라 연구소 측 실행 기록이고, 같은 계열 대형 오픈웨이트 모델이 공개 첫날부터 "수치가 홍보용"이라는 반발을 받은 전례(지난주 샤오미 건)가 바로 옆에 있다. 숫자는 직접 돌려볼 때까지는 후보로만 두는 게 맞다.

3. 바로 써먹기 — 오늘 내 장비에서 확인하는 세 가지

① 내 장비가 '로컬 프런티어' 어디쯤인지 재기

VRAM 24GB(또는 통합 메모리 128GB)와 그 아래는 여전히 7~35B급 로컬 모델이 현실적인 구간이다. 이 글의 프레임워크가 진짜라면 24GB에서 100B급 시대가 열리는 거고, 아니라도 "24GB로 뭘 돌릴 수 있는가"의 기준선이 바뀐다. 로컬 모델 선택 기준표가 몇 달 단위로 무의미해지는 이유다.

② 에이전트 세션 비만이 문제라면 — 압축부터

신규 도구를 깔기 전에, 이미 쓰는 에이전트에서 컨텍스트를 의식적으로 잘라보자. 장기 메모를 파일로 분리하고(이 사이트의 다른 잔에서 본 '메모리 파일' 설계가 바로 이 문제의 다른 해법이다), 세션은 짧게 끊고 요약만 넘기는 습관. 토큰 비용이 아까운 1인 운영자에게는 125B보다 이쪽이 오늘 당장의 절약이다.

# 내 에이전트가 쌓아둔 세션·로그 용량부터 실측 — 로컬 AI 비용의 9할은 저장·재전송이다
du -sh ~/.agent-home/* 2>/dev/null | sort -h | tail -5
find ~/.agent-home -name '*.log' -mtime +7 -delete -print | head -3  # 7일 지난 로그 정리 예시

③ 오프라인 자율 리서치는 '검증 도구'로만 쓰자

인터넷 없이 도는 리서치 에이전트라는 발표는, 민감 문서를 다루는 1인 사업자 입장에선 흥미롭다. 다만 성능 우위 주장이 전부 자체 벤치이므로, 도입은 "남이 검증한 뒤"가 안전측이다.

4. 해외 반응 쟁점

"개발자 수요가 늘었다니요" 반발이 최상단. 상위 댓글은 미국 연방준비은행 계열의 졸업생 실업 데이터를 들며 "전공별 실업률 상위권이 컴퓨터공학"이라고 맞섰다. "회복은 시니어 직급에만 국한됐다"는 후속 링크도 붙었다.

다수줄기는 '단위의 이동'이었다. "주니어는 AI를 전문가처럼 쓰는 능력이 직급이 됐다", "AI무장 주니어가 연봉 절반으로 시니어 몫을 대체하는 지점이 10년 전으로 돌아간 곳" — 일자리가 사라진다기보다 수요의 단위가 '사람'에서 '사람×AI 조합'으로 미끄러지고 있다는 진단이 공감을 얻었다.

"결국 모델은 여전히 빅랩 것" 진영. 프레임워크가 아무리 좋아도 프런티어급 학습은 못 따라간다는 회의론, "오픈웨이트 생태계의 상수는 늘 최신 학습물의 2등"이라는 정리도 같은 스레드에 있었다. 원문도 "우리는 최강 모델을 만드는 곳이 아니라, 만든 뒤 널리 퍼뜨리는 곳"이라는 톤이다.

5. 마시기 전 주의

바로 가기

같이 마시면 좋은 잔
"기본값은 기기 안"이라고 찍은 개발자 1,900명의 주장 — 로컬 AI 진영의 '왜 내 장비인가'라면, 이 잔은 '내 장비로 뭘까지 할 수 있나'의 답이다.
샤오미 오픈웨이트 1조짜리 두뇌 — 이번 주 로컬 쪽이 유독 시끄러운 이유. 돌릴 모델과 돌릴 장비의 소식이 같은 주에 몰렸다.
AI 실전편 시리즈 — 해외에서 검증된 워크플로만 골라 따라 하기 단계까지.