- 날짜는 그대로 넣지 말고 성분으로 분해(연/월/일/요일/시/주말·공휴일 플래그, 경과일).
- 주기형 변수(시·요일·월)는 사인/코사인 두 축으로 단위원에 매핑해야 23시와 0시가 인접해진다.
- 텍스트 벡터화는 BoW → TF-IDF → 임베딩 순으로 표현력이 올라간다. TF-IDF는 흔한 단어를 억제한다.
- 고카디널리티 범주형에 원핫은 차원 폭발. 타깃/빈도 인코딩, 해싱, 임베딩으로 통제한다.
- 해싱은 사전이 필요 없어 미지의 범주·스트리밍에 강하지만 충돌을 감수한다.
어제는 수치형과 일반 범주형을 다뤘다. 오늘은 별도 취급이 필요한 두 특수 데이터 — **날짜·시간(시계열)**과 텍스트 — 의 특성 공학, 그리고 인코딩의 영원한 숙제인 고카디널리티 범주형 처리를 본다. MLS-C01은 "어떤 데이터에 어떤 변환이 적절한가" 형태로 이 주제를 자주 낸다.
날짜 컬럼을 그대로(2026-06-26 14:30:00) 쓰면 모델이 의미를 읽지 못한다. 날짜는 성분으로 분해해야 한다.