- 학습은 Managed Spot + 체크포인트로 최대 90% 절감.
MaxWaitTimeInSeconds ≥ MaxRuntimeInSeconds가 짝이다.
- 인스턴스는 워크로드에 맞게 — 트리·선형=CPU, 딥러닝 학습=GPU, 딥러닝 추론 단가=Inferentia.
- 추론 비용의 본질은 유휴 구간 비용. 트래픽이 0으로 떨어지면 서버리스·비동기·배치로 그 구간을 0에 가깝게 만든다.
- 비용 급증의 범인은 대개 안 끈 리소스 — 유휴 노트북, 잊힌 엔드포인트, 끝나지 않는 학습. 자동 종료로 시스템이 막게 한다.
- 팀·프로젝트별 비용 분리는 비용 할당 태그 + Cost Explorer, 한도 관리는 Budgets가 정답이다.
지금까지가 안전하게(보안)였다면, 오늘은 싸게다. ML 워크로드는 GPU 인스턴스·대규모 학습·always-on 엔드포인트 때문에 비용이 빠르게 불어난다. 레버는 세 축으로 정리된다.