본문 바로가기

개발이야기

MaxText '탄력적 학습' — TPU 슬라이스 장애 후 2분 만에 재개한 이유

반응형

핵심 요약

Google은 2026년 7월 6일 MaxText + Pathways 기반 elastic training(탄력적 학습) 을 소개했다(〈Google Developers Blog〉 2026.07.06). 멀티 슬라이스 Cloud TPU 클러스터에서 워커를 의도적으로 종료해도, 동일 프로세스(PID) ·동일 컨트롤러2분 미만 내 다음 학습 스텝까지 복구했다고 밝혔다. 핵심은 elastic_retry 데코레이터 + GCS 체크포인트 + xpk --elastic-slices 조합이다. 대규모 LLM 사전학습에서 하드웨어 장애 = job 전체 재시작 이라는 관행을 줄이려는 인프라 레벨 변화다.

무슨 일이 있었나

데모 시나리오 (〈Google Developers Blog〉 2026.07.06)

  • GKE다중 TPU 슬라이스 에서 Qwen3 0.6B 학습
  • 학습 중 TPU worker pod 의도적 kill
  • kill → 다음 training step 까지 2분 미만(대부분 K8s replacement pod 스케줄링 대기)
  • 프로세스 재시작 없음in-process recovery

기술 구성

  • MaxText: elastic_enabled=true, enable_single_controller=True, checkpoint_period (작게 설정)
  • Pathways: xpk workload create-pathways + --elastic-slices, --max-slice-restarts
  • elastic_min_slice_count: 기본 -1(전체 슬라이스) = pause-and-resume 모드
  • 값을 1 ~ numSlices-1 로 두면 surviving slices 만으로 replica resize 가능

복구 흐름 (공식 문서, 〈MaxText GitHub〉 2026)

1. 슬라이스 장애 → Pathways orchestrator가 예외 발생

2. elastic_retry마지막 valid checkpointGCS 에서 복원

3. 동일 컨트롤러 에서 학습 재개 — JobSet 전체 재시작 불필요

관련 플래그 (〈MaxText docs〉)

  • elastic_timeout_seconds, elastic_max_retries
  • checkpoint_period=100 등 — rewind 손실 최소화

개발·MLOps 관점 해석

왜 중요한가

  • 초대형 LLM 학습은 수천 칩·수주단일 슬라이스 MTBF필연적 장애
  • 기존: 전체 job restart수 시간~수일 낭비 + 체크포인트 간격 트레이드오프

운영 함의

  • checkpoint_period 를 줄이면 복구 손실↓, I/O 부하↑ — elastic training과 함께 튜닝
  • --elastic-slices (Pathways) vs elastic_min_slice_count (MaxText) 의미가 다름 — 혼동 주의

한계

  • pause-and-resume전체 슬라이스 손실대기replica resize별도 모드
  • 합성 데이터(synthetic) 데모 — 프로덕션 데이터 파이프라인 장애는 별도 설계

고유 인사이트

  • elastic training의 진짜 비용 절감은 GPU/TPU 시간 보다 "실험 iteration 속도" 에 있다. 장애 후 2분 이면 하이퍼파라미터 실험 일정이 날짜 단위 가 아니라 시간 단위 로 짜일 수 있다. 다만 체크포인트 주기 100 step데모용 — 실서비스에서는 데이터셋·step time 에 맞춰 checkpoint_period vs storage costSLA 표로 문서화해야 한다. MaxText 문서가 xpk와 in-manifest proxy 두 경로를 모두 제공하는 이유도 팀별 배포 방식 차이 때문이다.

체크포인트와 리스크

  • 체크포인트
  • MaxText + Pathways 버전 호환 매트릭스
  • GCS checkpoint 비용·TTL 정책
  • elastic vs non-elastic job 비용 비교(idle wait time)
  • 리스크 요인
  • 잘못된 elastic_min_slice_count무한 대기 또는 데이터 불일치
  • checkpoint corruptionvalid checkpoint 검증 로직 필수
  • Preview APIminor breaking 가능(Genkit Agents와 유사)

마무리

MaxText elastic training은 "LLM 학습 = 불가역적 장기 배치" 관행에 탄력성 을 더하는 인프라 진화다. 애플리케이션 개발자보다 MLOps·플랫폼 엔지니어 가 먼저 검토할 주제지만, 2026년 self-hosted·private LLM 트렌드와 맞닿아 있다. 도입 시 데모가 아닌 자사 클러스터 에서 의도적 fault injection 테스트를 권장한다.

참고 자료