- Data Wrangler = 시각적·노코드 데이터 준비. 300여 개 내장 변환 + 데이터 품질·인사이트 리포트 + 흐름 내보내기.
- Processing Job = 코드 기반 관리형 분산 전처리. 컨테이너로 실행하고 끝나면 인프라 자동 종료.
- Feature Store = 피처를 저장·공유·재사용하는 중앙 저장소. Online(ms급 단건) / Offline(대량 학습용).
- Feature Store의 핵심 가치는 training-serving skew 제거와 point-in-time 정확성이다.
- 시험 단서: "노코드/시각적" → Data Wrangler, "대규모 커스텀 코드" → Processing Job, "학습·추론 일관성/피처 재사용" → Feature Store.
지난 사흘간 데이터 정제와 특성 공학을 개념·코드 수준에서 다뤘다. 오늘은 같은 작업을 AWS에서 규모 있게, 재현 가능하게, 재사용 가능하게 수행하는 SageMaker 서비스 세 가지를 본다.
Data Wrangler는 SageMaker Studio 안의 시각적 데이터 준비 도구다. 코드를 거의 쓰지 않고 결측치 대치, 인코딩, 스케일링, 이상치 처리 등 300개 이상의 내장 변환을 클릭으로 적용한다.
핵심 기능: