- Data Wrangler는 소스 연결 → 변환 → 분석 → 내보내기 4단계를 GUI로 묶은 데이터 준비 도구다.
- 핵심 개념은 flow — 변환 단계를 순서가 고정된 DAG로 남겨 재현성을 보장한다.
- 화면에서 보는 데이터는 샘플이다. 전체 적용은 export한 Processing Job이 한다.
- Data Quality 리포트·Quick Model·Target Leakage 분석으로 학습 전에 데이터 문제를 잡아낸다.
- Pipelines·Feature Store로 export하면 학습·추론이 같은 변환을 써 training/serving skew를 막는다.
어제 본 스케일링·인코딩·결측치 처리를 매번 pandas로 손코딩하면 시간이 오래 걸리고, 적용한 변환 순서를 재현하기도 어렵다. Data Wrangler는 이 전체 흐름을 시각적 인터페이스로 묶어주는 SageMaker Studio 내장 도구다.
핵심은 flow라는 개념이다. flow는 데이터 소스 → 변환 단계들 → 출력으로 이어지는 방향성 그래프(DAG)이며, 각 노드가 하나의 데이터 처리 단계다. 사용자가 GUI에서 변환을 추가하면 Data Wrangler가 내부적으로 그에 해당하는 코드(pandas/PySpark)를 생성한다.