핵심 요약
전 OpenAI CTO 미라 무라티(Mira Murati)가 설립한 Thinking Machines Lab이 2026년 7월 15일 첫 자체 모델 Inkling의 전체 가중치를 Apache 2.0 라이선스로 공개했다(〈Thinking Machines〉 2026-07-15). 975B 총 파라미터·41B active MoE, 100만 토큰 컨텍스트, 텍스트·이미지·오디오 입력을 지원한다. Hugging Face·Tinker API·TogetherAI 등에서 day-0로 접근 가능하며, vLLM·SGLang·llama.cpp 등 추론 엔진을 지원한다. 회사는 "최강 모델"이 아니라 파인튜닝·도메인 적응에 적합한 오픈 베이스를 목표로 했다고 밝혔다. 실무에서는 GPU 메모리(풀 BF16 약 2TB, NVFP4 약 600GB)와 라우터 API·로컬 양자화 경로를 먼저 정리하는 것이 핵심이다.
무슨 일이 있었나
Thinking Machines는 7월 15일 블로그와 Hugging Face에서 Inkling을 공개했다(〈Thinking Machines〉 2026-07-15, 〈Hugging Face Blog〉 2026-07-15). 모델은 45조 토큰(텍스트·이미지·오디오·비디오) 사전학습, controllable thinking effort(추론 토큰 조절), 멀티모달 입력이 특징이다.
배포 채널. ▲Hugging Face: thinkingmachines/Inkling(BF16), Inkling-NVFP4(Blackwell) ▲Tinker 플랫폼: 64K·256K 컨텍스트, 파인튜닝·RL ▲서드파티 API: TogetherAI, Fireworks, Modal, Databricks, Baseten(〈The Register〉 2026-07-16) ▲추론: transformers 5.14.0+, vLLM, SGLang, llama.cpp(〈Hugging Face Blog〉 2026-07-15).
성능 포지셔닝. 공식 자료는 GPT 5.6 Sol·Claude Fable 5 등 클로즈드와 비교 스파이더 차트를 제공하지만, "오늘 날 최강은 아니다"고 명시한다(〈Thinking Machines〉 2026-07-15). 대신 Terminal Bench 2.1에서 Nemotron 3 Ultra 수준을 약 1/3 토큰으로 달성하는 등 효율·커스터마이즈를 강조한다. 경량 Inkling-Small(276B total, 12B active) 프리뷰도 공개됐다.
기술 커뮤니티 해석
The Register(2026-07-16)는 "Altman이 하지 않은 일—프론티어급 오픈웨이트"로 headline을 달았다. Technology.org는 AI 붐이 '피크 지능'에서 '작업당 비용(cost per finished task)' 으로 이동 중이라며, Inkling이 엔터프라이즈 에이전트 대신 다운로드·튜닝 가능한 베이스를 노린다고 분석했다.
Hugging Face 팀(2026-07-15)은 day-0 transformers·SGLang 지원, ggml 양자화로 로컬 배포, any-to-any 파이프라인 예제를 제공했다. 개발자 관심은 ▲1M 컨텍스트 RAG·코드베이스 ▲오디오·이미지 네이티브 에이전트 ▲Tinker 파인튜닝 레시피에 집중된다.
실무 체크포인트 (고유 정리)
Inkling을 PoC·프로덕션에 도입할 때 아래 5단계를 권장한다.
1. 하드웨어·양자화 선택: Blackwell이면 NVFP4(600GB VRAM), 그 외는 API·양자화 ggml 또는 Inference Providers.
2. 컨텍스트 tier: Tinker 64K/256K vs 로컬 1M—비용·지연 trade-off 명시.
3. 파인튜닝 경로: 도메인 데이터는 Tinker cookbook(RL·distillation) vs 자체 LoRA—Apache 2.0 상업 이용 조건 확인.
4. 벤치마크 재현: 공식 effort=0.99 설정과 자체 업무 데이터셋 분리 측정(〈Hugging Face Model Card〉 2026-07-14).
5. 보안·컴플라이언스: 오픈웨이트는 온프레미 배포에 유리하나, 가중치 유출·내부 데이터 혼입 정책은 별도.
마무리
Inkling은 '무료 GPT-5'가 아니라 튜닝 가능한 멀티모달 MoE 인프라에 가깝다. GPU 2TB급 요구는 대부분 팀에게 API·양자화·Small 프리뷰가 현실적 진입점이다. 클로즈드 플래그십과 경쟁하기보다, RAG·사내 에이전트·특화 모델 베이스로 평가하는 것이 Thinking Machines의 의도와 맞다.
참고 자료
- Inkling: Our open-weights model - Thinking Machines Lab (2026-07-15)
- Welcome Inkling by Thinking Machines - Hugging Face Blog (2026-07-15)
- thinkingmachines/Inkling - Hugging Face (2026-07-15)
- Former OpenAI CTO releases a frontier AI model that's actually open - The Register (2026-07-16)
- Thinking Machines Releases Inkling Open-Weights Model - Technology.org (2026-07-16)
'개발이야기' 카테고리의 다른 글
| Moonshot Kimi K3, 2.8조 파라미터 오픈웨이트가 코딩 에이전트 판도를 흔들까 (1) | 2026.07.18 |
|---|---|
| GitHub Copilot SDK GA, 코딩 에이전트를 '내 앱 안'에 넣는 시대 (0) | 2026.07.18 |
| OpenAI GPT-Red, AI가 AI를 red-team하는 self-play 안전 파이프라인 정리 (0) | 2026.07.17 |
| Gemini 3.5 Pro 7월 17일 GA 루머, 개발자가 공식 출시 전에 준비할 것 (0) | 2026.07.17 |
| GPT-5.6 Sol 파일 삭제 논란, AI 코딩 에이전트 '과잉 자율성'을 어떻게 막을까 (0) | 2026.07.16 |