핵심 요약
문샷AI(Moonshot AI)는 2026년 7월 16일 키미 K3를 공개했다. 2.8조 파라미터 MoE, 100만 토큰 컨텍스트, 네이티브 비전, MXFP4 양자화가 핵심이다(〈Kimi 공식 블로그〉 2026-07-16, 〈Hugging Face〉 2026-07-17). API는 이미 kimi-k3로 제공되며, 전체 가중치 공개는 7월 27일 예정이다. 개발자 입장에서는 '또 하나의 중국 오픈 모델'을 넘어, 3T급 모델을 API·셀프호스팅 양쪽에서 검증할 수 있는 첫 기회다.
무슨 일이 있었나
모델 스펙. Kimi 공식 블로그(2026-07-16): 총 2.8T 파라미터, Kimi Delta Attention(KDA) + Attention Residuals, 1M 토큰 컨텍스트. Hugging Face 블로그(2026-07-17)는 896 experts 중 16개 활성(Stable LatentMoE), 학습·추론에 MXFP4 weight / MXFP8 activation 사용을 정리했다. FP16 대비 가중치 저장 약 1.4TB(FP16이면 ~5.6TB).
접근 경로. Kimi.com, Kimi Work(데스크톱 3.1.0+), Kimi Code(터미널 /model), Kimi API(kimi-k3). API 가격: 캐시 히트 입력 $0.30/MTok, 미스 $3.00/MTok, 출력 $15.00/MTok(〈Kimi〉 2026-07-16). Mooncake 분산 추론으로 코딩 워크로드 캐시 히트율 90%+ 주장.
벤치·포지셔닝. The Next Web(2026-07-16): Moonshot 자체 벤치에서 Anthropic Fable 5·OpenAI GPT-5.6 Sol 다음 2위. DEV Community(2026-07-17)는 Claude Fable 5·GPT-5.6 Sol 대비 약 절반 가격 포지셔닝을 정리했다.
가중치 공개 일정. 7월 27일 전체 weight release 예정. The Next Web은 수정 MIT 라이선스 가능성을 언급했으나 최종 미확정. 7월 16~26일은 API·앱만으로 벤치 재현 불가 구간이다.
시장 파장. 17일 뉴욕 반도체주 급락과 연결되며(〈조선일보〉 2026-07-20), '저가 오픈 AI → AI capex 의문' narrative가 확산됐다.
시장·개발자의 해석
긍정. 1M 컨텍스트 + 코딩 특화 + 저가 API는 장기 에이전트·대형 레포 분석에 실험 가치가 있다. MXFP4는 Blackwell·MI400 등 최신 GPU에서 네이티브 지원(Hugging Face 2026-07-17) → 셀프호스팅 비용 곡선 개선 가능.
주의. 7월 27일 전까지는 벤치 숫자를 외부가 재현할 수 없다. 2.8T 셀프호스팅은 Hugging Face 추정 64+ accelerator supernode급 인프라가 필요하다. 대부분 팀은 API 경로가 현실적이다.
딥시크·K2와 비교. Kimi K3는 DeepSeek V4 Pro(1.6T), Kimi K2.6(1T)보다 크다(DEV Community 2026-07-17). '크기 경쟁'이 다시 3T대로 이동했음을 의미한다.
고유 인사이트: 7월 27일 weight drop 전 개발팀이 할 일은 벤치 순위 경쟁이 아니라 동일 코딩 태스크 50건을 Kimi K3 API vs 기존 모델(GPT-5.6·Claude)로 A/B하고, 토큰 수·비용·패치 품질을 스프레드시트에 남기는 것이다. 3T 오픈 모델의 실무 가치는 leaderboard 2위가 아니라 MTok당 $0.30 캐시 히트에서 실제 diff merge율로 결정된다. 또한 K3 쇼크로 반도체주가 흔들린 것은 개발자에게 '모델 비용↓ = GPU 수요↓?' narrative를 주의 깊게 봐야 함을 시사한다 — inference 효율(KDA 6.3× decode speedup 주장)이 capex narrative와 직결된다.
체크포인트와 리스크
- 체크포인트
- 7월 27일 weight·license·technical report 공개
- Kimi API rate limit·데이터 거주 정책
- MXFP4 호환 GPU에서 latency·throughput 측정
- 내부 코딩 eval vs GPT-5.6·Claude
- 리스크 요인
- 벤치 재현 실패 시 신뢰도 하락
- 중국산 모델 compliance(기업 데이터 정책)
- API 가격·캐시 정책 변경
마무리
키미 K3는 3T급 오픈 프론티어라는 레이블과 7월 27일 weight 공개라는 일정이 핵심이다. 지금은 API로 조기 실험하고, weight 공개 후 재현·파인튜닝·온프레미스 TCO를 검증할 타이밍이다. 증시 파장과 별개로, 개발팀은 비용 대비 코딩 품질만 숫자로 남기면 된다.
참고 자료
'개발이야기' 카테고리의 다른 글
| Hugging Face, 자율 AI 에이전트 침해 공개… 'AI가 AI를 공격·탐지' 시대 (0) | 2026.07.24 |
|---|---|
| Cursor repo-poisoning 제로데이, 무공지 패치… Windows 개발자가 할 일 (0) | 2026.07.24 |
| GPT-5.6 Codex가 $HOME을 지운 사건, Full Access를 쓰기 전에 읽을 것 (0) | 2026.07.20 |
| 에이전트 코딩 2026 — '모델 성능' 다음은 '실행 권한 설계' (0) | 2026.07.20 |
| ChatGPT와 Codex가 하나로, OpenAI 'Work mode'가 바꾸는 개발·업무 경계 (1) | 2026.07.19 |