본문 바로가기

개발이야기

GPT-5.6 Sol·Terra·Luna API — 개발팀이 설계할 모델 라우팅 전략

반응형

핵심 요약

OpenAI는 2026년 7월 9일 GPT-5.6 모델 패밀리를 ChatGPT·Codex·APIGA(일반 공개) 했다(〈OpenAI〉 2026.07.09). 세 티어는 Sol(플래그십)·Terra(균형)·Luna(고효율) 로 나뉘며, API 가격은 Sol 입력 $5/출력 $30, Terra $2.50/$15, Luna $1/$6(per 1M tokens, 〈TechCrunch〉 2026.07.09)이다. Responses API에는 Programmatic Tool Calling, multi-agent beta, ultra 설정(기본 4개 병렬 에이전트) 이 추가됐다(〈OpenAI〉 2026.07.09). 7월 10일 초안에서 다룬 ChatGPT Work·Codex 통합 UI와 달리, 이번 글은 백엔드·자동화 파이프라인에서 모델 ID·reasoning effort·비용 상한을 어떻게 잡을지에 초점을 둔다.

무슨 일이 있었나

모델 티어·API ID (〈OpenAI API Docs〉 2026.07)

| 티어 | API ID | 용도 | 입력/출력 (1M) |

| --- | --- | --- | --- |

| Sol | gpt-5.6-sol (gpt-5.6 별칭) | 코딩·연구·장기 작업 | $5 / $30 |

| Terra | gpt-5.6-terra | 일상 에이전트·균형 | $2.50 / $15 |

| Luna | gpt-5.6-luna | 대량 분류·추출 | $1 / $6 |

  • 컨텍스트: 약 105만 토큰, 최대 출력 128K
  • 도구: functions, web search, computer use 지원(〈Developers Digest〉 2026.07.09)

reasoning·ultra (〈OpenAI〉 2026.07.09)

  • reasoning.effort: none ~ max잠재력 대비 지연·비용 트레이드오프
  • ultra: 기본 4개 서브에이전트 병렬 → BrowseComp·SEC-Bench 등에서 지연 대비 점수 개선
  • multi-agent beta: Responses API 한 요청 안에서 동시 서브에이전트 실행·합성

벤치마크 주장 (〈TechCrunch〉 2026.07.09)

  • OpenAI는 Artificial Analysis Coding Agent Index에서 Sol이 Fable 5 대비 +2.8p, 출력 토큰·시간·비용은 절반 이하라고 밝혔다. 독립 검증 전에는 마케팅 수치로만 참고하는 것이 안전하다.

개발자 관점 해석

① 별칭 gpt-5.6은 Sol로 라우팅

문서상 gpt-5.6 요청은 gpt-5.6-sol 로 간다(〈OpenAI API Docs〉). 비용 민감 워크로드에 별칭을 그대로 쓰면 의도치 않게 $30/1M 출력이 발생할 수 있다. CI·배치 잡은 gpt-5.6-luna를 명시하고, 릴리스 노트에 모델 ID 고정을 적어 두는 편이 낫다.

② reasoning effort는 "기본 medium"이 아닌 "측정 후 한 단계 낮추기"

마이그레이션 가이드는 GPT-5.5·5.4 대비 한 단계 낮은 effort에서 품질을 비교하라고 권한다(〈OpenAI API Docs〉). 실무에서는 동일 프롬프트·동일 테스트셋으로 low vs medium 통과율·토큰·지연을 표로 남기고, 통과율 차이 1% 미만이면 low 고정이 일반적이다.

③ ultra/multi-agent는 feature flag 뒤에

Developers Digest 등 실무 블로그도 단일 에이전트 + evaluator를 먼저 두고, 독립 서브태스크에만 병렬을 켜라고 권한다(〈Developers Digest〉 2026.07.09). 합성(synthesis) 단계에서 충돌 해결 규칙이 없으면 네 배 비용에 엉뚱한 답이 나올 수 있다.

고유 인사이트: "3티어 + effort" 라우터 스키마

프로덕션에서 재사용 가능한 최소 스키마는 다음과 같다. Tier A(코드 리뷰·아키텍처): gpt-5.6-sol, effort high, 턴 상한 8. Tier B(일반 PR 생성·문서): gpt-5.6-terra, effort medium. Tier C(로그 분류·메타데이터): gpt-5.6-luna, effort low 또는 none. Tier U(분기 1회 감사): ultra/multi-agent, 예산 캡 $N. 라우터 입력은 태스크 유형 enum + 예상 출력 토큰 두 필드만으로도 월 비용 30~50% 절감 사례가 흔하다 — 핵심은 Sol을 기본값으로 두지 않는 것이다.

체크포인트와 리스크

  • 체크포인트
  • 모델 ID 핀ninggpt-5.6 별칭 vs -terra/-luna
  • reasoning effort 매트릭스 — 대표 20개 태스크 A/B
  • multi-agent — feature flag + 단일 에이전트 fallback
  • ZDR — Programmatic Tool Calling과 데이터 보존 정책 정합성
  • 리스크 요인
  • 출력 $30/1M — 장문·루프 시 요금 폭탄
  • 벤치마크 ≠ 내부 레포 — SWE-Bench 상승이 PR merge율로 이어지지 않을 수 있음
  • beta API 변경 — multi-agent 스펙·한도 변동
  • 벤더 lock-in — 라우터 추상화 없이 Sol 하드코딩

마무리

GPT-5.6 GA는 "더 똑똑한 모델" 보다 "티어가 갈라진 상품군" 이라는 신호에 가깝다. 7월 11일 시점에서 개발팀이 할 일은 새 모델 찬양이 아니라 라우터·예산·eval 세트를 갱신하는 것이다. Sol·ultra는 소수의 고난도 잡에만 쓰고, Terra·Luna가 일상 트래픽의 80% 를 먹게 설계하면, 같은 주에 나온 Meta Spark·Google AlphaEvolve와 공존하면서도 비용을 통제할 수 있다.

참고 자료