class_weight="balanced", XGBoost scale_pos_weight)와 임계값 조정.현실의 분류 문제는 대부분 불균형하다. 사기는 0.1%, 질병 양성은 2%, 이탈은 5% — 정작 잡고 싶은 것이 소수 클래스다. 원본 불균형 데이터로 학습하면 모델은 전부 다수 클래스로 찍어 놓고도 높은 정확도를 얻는다.
양성이 2%인 데이터에서 "전부 음성"이라고 예측하면 정확도 98%가 나온다. 그런데 정작 관심 있는 양성은 하나도 못 잡는다. 이것이 **정확도 역설(accuracy paradox)**이다.