- Athena는 서버리스 SQL로 S3를 직접 쿼리한다. 과금은 스캔한 데이터량($5/TB) — 스캔량 절감이 곧 비용 절감.
- Athena 3대 비용 레버: 열 기반 포맷(Parquet) + 파티셔닝 + 압축.
- Redshift는 적재형 데이터웨어하우스(MPP). 반복적 고성능 BI에 강하다. Spectrum이 S3와의 다리.
- Redshift ML은
CREATE MODEL SQL로 데이터를 옮기지 않고 모델을 학습·추론한다.
- 모델링 전 EDA로 분포·결측·이상치·상관·클래스 불균형·데이터 누수를 반드시 점검한다.
데이터를 수집·카탈로그화했다면 이제 읽고 이해할 차례다. 모델을 만들기 전 데이터 사이언티스트는 반드시 데이터를 들여다본다 — 이것이 **EDA(Exploratory Data Analysis)**다.
Athena는 S3에 저장된 데이터를 서버리스 SQL로 쿼리하는 서비스다. Presto/Trino 엔진 기반이고 클러스터 프로비저닝이 전혀 없다. Glue Data Catalog의 테이블 정의를 그대로 사용한다.
- 서버리스: 인프라 관리 없음. 쿼리할 때만 동작.
- schema-on-read: 데이터를 옮기지 않고 S3에 둔 채로 쿼리.
- 과금 = 스캔한 데이터량: 쿼리가 스캔한 바이트당 과금($5/TB)