핵심 요약
Google은 2026년 7월 6일 MaxText + Pathways 기반 elastic training(탄력적 학습) 을 소개했다(〈Google Developers Blog〉 2026.07.06). 멀티 슬라이스 Cloud TPU 클러스터에서 워커를 의도적으로 종료해도, 동일 프로세스(PID) ·동일 컨트롤러 로 2분 미만 내 다음 학습 스텝까지 복구했다고 밝혔다. 핵심은 elastic_retry 데코레이터 + GCS 체크포인트 + xpk --elastic-slices 조합이다. 대규모 LLM 사전학습에서 하드웨어 장애 = job 전체 재시작 이라는 관행을 줄이려는 인프라 레벨 변화다.
무슨 일이 있었나
데모 시나리오 (〈Google Developers Blog〉 2026.07.06)
- GKE 위 다중 TPU 슬라이스 에서 Qwen3 0.6B 학습
- 학습 중 TPU worker pod 의도적 kill
- kill → 다음 training step 까지 2분 미만(대부분 K8s replacement pod 스케줄링 대기)
- 프로세스 재시작 없음 — in-process recovery
기술 구성
- MaxText:
elastic_enabled=true,enable_single_controller=True,checkpoint_period(작게 설정) - Pathways:
xpk workload create-pathways+--elastic-slices,--max-slice-restarts elastic_min_slice_count: 기본 -1(전체 슬라이스) = pause-and-resume 모드- 값을 1 ~ numSlices-1 로 두면 surviving slices 만으로 replica resize 가능
복구 흐름 (공식 문서, 〈MaxText GitHub〉 2026)
1. 슬라이스 장애 → Pathways orchestrator가 예외 발생
2. elastic_retry 가 마지막 valid checkpoint 를 GCS 에서 복원
3. 동일 컨트롤러 에서 학습 재개 — JobSet 전체 재시작 불필요
관련 플래그 (〈MaxText docs〉)
elastic_timeout_seconds,elastic_max_retriescheckpoint_period=100등 — rewind 손실 최소화
개발·MLOps 관점 해석
왜 중요한가
- 초대형 LLM 학습은 수천 칩·수주 — 단일 슬라이스 MTBF 는 필연적 장애
- 기존: 전체 job restart → 수 시간~수일 낭비 + 체크포인트 간격 트레이드오프
운영 함의
checkpoint_period를 줄이면 복구 손실↓, I/O 부하↑ — elastic training과 함께 튜닝--elastic-slices(Pathways) vselastic_min_slice_count(MaxText) 의미가 다름 — 혼동 주의
한계
- pause-and-resume 은 전체 슬라이스 손실 시 대기 — replica resize 는 별도 모드
- 합성 데이터(synthetic) 데모 — 프로덕션 데이터 파이프라인 장애는 별도 설계
고유 인사이트
- elastic training의 진짜 비용 절감은 GPU/TPU 시간 보다 "실험 iteration 속도" 에 있다. 장애 후 2분 이면 하이퍼파라미터 실험 일정이 날짜 단위 가 아니라 시간 단위 로 짜일 수 있다. 다만 체크포인트 주기 100 step 은 데모용 — 실서비스에서는 데이터셋·step time 에 맞춰 checkpoint_period vs storage cost 를 SLA 표로 문서화해야 한다. MaxText 문서가
xpk와 in-manifest proxy 두 경로를 모두 제공하는 이유도 팀별 배포 방식 차이 때문이다.
체크포인트와 리스크
- 체크포인트
- MaxText + Pathways 버전 호환 매트릭스
- GCS checkpoint 비용·TTL 정책
- elastic vs non-elastic job 비용 비교(idle wait time)
- 리스크 요인
- 잘못된 elastic_min_slice_count → 무한 대기 또는 데이터 불일치
- checkpoint corruption — valid checkpoint 검증 로직 필수
- Preview API — minor breaking 가능(Genkit Agents와 유사)
마무리
MaxText elastic training은 "LLM 학습 = 불가역적 장기 배치" 관행에 탄력성 을 더하는 인프라 진화다. 애플리케이션 개발자보다 MLOps·플랫폼 엔지니어 가 먼저 검토할 주제지만, 2026년 self-hosted·private LLM 트렌드와 맞닿아 있다. 도입 시 데모가 아닌 자사 클러스터 에서 의도적 fault injection 테스트를 권장한다.
참고 자료
'개발이야기' 카테고리의 다른 글
| GhostApproval 취약점 — AI 코딩 에이전트 6종, symlink로 샌드박스를 우회하다 (0) | 2026.07.09 |
|---|---|
| OWASP 'AI 코딩 보안' 치트시트 — 에이전트 시대에 새로 생긴 위협 (0) | 2026.07.08 |
| Google ADK 2.0 — 에이전트와 워크플로를 섞는 '하이브리드' 설계 (0) | 2026.07.08 |
| Ornith-1.0 — '자기 스캐폴딩' 오픈소스 코딩 모델이 바꾸는 에이전틱 개발 (0) | 2026.07.07 |
| Mozilla Otari — LLM '컨트롤 플레인'이 프로덕션 AI에 필요한 이유 (0) | 2026.07.07 |