- SageMaker Clarify는 학습 전 데이터 편향과 학습 후 예측 편향·설명가능성(SHAP)을 분석한다.
- 편향 분석의 기준은 민감 속성(facet). 대표 지표는 **CI(그룹 간 표본 불균형)**와 DPL(긍정 레이블 비율 차이).
- 클래스 불균형은 언더/오버샘플링·SMOTE·class weight로 다룬다. 반드시 분할 후 학습 셋에만 적용.
- 분할은 train/validation/test 3분할. test는 마지막에 단 한 번만 본다.
- 불균형이면 층화 분할, 시계열이면 시간 분할. 데이터가 적으면 k-fold 교차검증.
특성을 잘 만들어도 데이터 자체가 한쪽으로 치우쳐 있으면 모델은 그 편향을 그대로 학습한다. 대출 심사 모델이 특정 성별에 불리하게 판단하거나, 사기 탐지 모델이 0.1%뿐인 사기를 전부 놓치는 일이 대표적이다.
SageMaker Clarify는 두 가지 일을 한다.