- 스케일링은 거리·기울기 기반 모델(KNN, SVM, 선형/로지스틱, 신경망, PCA)에 필수, 트리 계열엔 불필요하다.
- 이상치가 많으면 Min-Max 대신 RobustScaler(중앙값·IQR 기반)를 쓴다.
- 인코딩은 순서가 있으면 Ordinal, 없으면 One-Hot, 고카디널리티면 Target/Hashing/임베딩.
- 타깃 인코딩은 강력하지만 타깃 누수 위험이 있다. K-fold나 스무딩이 필요하다.
- 비닝은 선형 모델에 비선형성을 주지만 정보 손실을 감수한다. 공통 원칙은 모든 변환을 학습셋으로만 fit.
정제로 데이터를 깨끗하게 만들었다면 이제 모델이 잘 학습할 수 있는 형태로 변형할 차례다. 특성 공학은 흔히 "모델 성능의 80%를 좌우한다"고 말할 정도로 ML 파이프라인에서 비중이 크다.
많은 알고리즘이 피처의 **스케일(크기)**에 민감하다. 나이(0100)와 소득(01억)을 그대로 넣으면 거리·기울기 계산에서 소득이 압도한다.