본문 바로가기

개발이야기

에이전트 루프 비용 폭주…토큰 인플레이션을 막는 설계 패턴

반응형

핵심 요약

2026년 하반기 개발 트렌드는 '한 번의 프롬프트'가 아니라 에이전트가 에이전트를 호출하는 재귀 루프다. Anthropic Claude Code 팀의 Boris Cherny는 Meta @Scale(2026.06.19)에서 "루프가 코딩의 다음 시대"라고 말했고(〈TechCrunch〉 2026.06.22), GitHub·OpenAI·Cursor도 병렬·장시간 에이전트를 기본값에 가깝게 밀고 있다. 문제는 루프가 길어질수록 컨텍스트 창 전체를 매 턴 API에 다시 넣는 구조 때문에 토큰 소비가 기하급수적으로 늘 수 있다는 점이다(〈Insights on AI ROI〉 2026.06.02). 송장을 맞추려면 모델 튜닝보다 실행 상한·상태 머신·코디네이터-스페셜리스트 분리가 먼저다.

무슨 일이 있었나

Claude Code의 내부 구조는 대략 (1) 메타데이터 생성 → (2) 도구 호출 루프 → (3) 결과 요약 순이다. "이 코드베이스 설명해줘" 같은 요청만 해도 Explore 타입 서브에이전트가 spawn되고, 부모·자식 간 컨텍스트가 분리·병합되며 여러 LLM 왕복이 발생한다(George Sung, Medium 2026.01). Cherny는 장시간 plan-act-test-review 루프가 팀 내부에서 이미 표준이라고 밝혔다(〈AIntelligenceHub〉 2026.06).

기업 현장에서는 루프 한 번에 수십 달러가 나가 레거시 RPA 대비 비용 대비 효과가 깨진다는 보고가 나온다(〈Insights on AI ROI〉). OpenAI Codex·GitHub Copilot cloud agent도 같은 패턴: 목표를 주면 수 시간 자율 실행 → 토큰·Actions·리뷰 인력이 누적된다.

시장의 해석 — 왜 '더 똑똑한 모델'만으로는 부족한가

루프 비용은 모델 단가 × 턴 수 × 컨텍스트 길이의 곱이다. 재귀 self-correction은 품질은 올리지만, 실패한 시도·전체 로그·서브에이전트 결과가 매 턴 다시 들어간다. 그래서 업계는 다음 가드레일을 공통 패턴으로 수렴 중이다.

| 패턴 | 역할 |

|------|------|

| max turns / max depth | 루프·서브에이전트 깊이 하드캡 |

| per-task budget (USD/AIC) | 작업별 토큰·비용 상한, 초과 시 중단 |

| coordinator + specialist | 가벼운 코디네이터가 작업 쪼개고, 무거운 모델은 서브태스크만 |

| MCP·RAG 1-call retrieval | 루프 길이를 줄이는 공유 지식층 |

| deterministic state machine | 허용 전환(탐색→수정→검증)만 정의, 무한 재시도 금지 |

Cherny도 "루프 상태·지속 시간·비용을 로그 파일 이상으로 보여줄 UI"가 플랫폼 경쟁의 다음 관문이라고 했다(〈AIntelligenceHub〉). 즉 observability + kill switch가 기능 차별점이 된다.

고유 인사이트: 비용 폭주의 1순위 원인은 '모델이 멍청해서'가 아니라 검증기(verifier)가 느슨해서다. 테스트·린트·diff 크기 같은 cheap check를 LLM 호출 전에 두면, 루프가 "틀림 → LLM 재질문" 대신 "틀림 → 규칙 기반 중단"으로 끊긴다. Ralph Loop·OpenClaw 커뮤니티에서도 human-in-the-loop checkpoint를 두는 fork가 비용 대비 성공률이 높다고 공유된다.

체크포인트와 리스크

  • 체크포인트:
  • 팀별 루프 허용 범위(버그fix vs greenfield vs 리팩터)
  • 턴당·일당 USD/AIC cap과 초과 시 escalation 경로
  • 서브에이전트 spawn 조건(Explore 전용 vs 모든 Task)
  • MCP 도구 수·컨텍스트 bloat(Agent Finder 등으로 최소화)
  • 루프 종료 후 아티팩트 감사·롤백 절차
  • 리스크 요인:
  • 무제한 Auto 모델 + 긴 system prompt
  • 서브에이전트 연쇄 spawn으로 depth 폭주
  • 캐시 미스·긴 repo 전체 read
  • 품질 검증 없이 '돌릴수록 좋다'는 문화

마무리

에이전트 루프는 2026년 하반기 생산성의 중심이 될 가능성이 크지만, 통제 없는 자율성은 곧 통제 불가능한 비용이다. Copilot AIC·Claude Code·Codex를 쓰는 팀은 "어떤 문제에 루프를 쓸지" 정책을 코드 리뷰 가이드만큼 진지하게 문서화해야 한다. max depth, per-task budget, coordinator-specialist, cheap verifier 네 가지만 적용해도 토큰 곡선은 눈에 띄게 완만해진다.

참고 자료