- ETL = Extract → Transform → Load. ML에서 이 결과물이 곧 학습 데이터셋이라 변환 로직의 정확성·재현성이 모델 품질을 좌우한다.
- Glue = 서버리스 Spark. 운영 부담이 적고 산발적·표준적 ETL에 적합. 과금은 DPU-시간.
- EMR = EC2 클러스터 위 Hadoop/Spark/Hive/Presto. 세밀한 튜닝·다중 프레임워크·스팟 절감이 필요할 때.
- 대규모 전처리의 4대 저장 전략: 컬럼형 포맷 · 파티셔닝 · 파일 크기 최적화 · 푸시다운.
- 역할 분담: 데이터레이크 전반의 공유 정제 = Glue, 특정 모델 전용 전처리 = SageMaker Processing.
지난 주에 데이터를 "어디서, 어떻게 가져오는가"(수집·저장)를 다뤘다. 이제 그 원시 데이터를 모델이 먹을 수 있는 형태로 가공하는 단계다. MLS-C01에서 ETL은 "어떤 도구를, 어떤 규모에서, 어떤 비용·운영 부담으로 선택하는가"를 묻는 핵심 영역이다.