- Glue Data Catalog는 Hive Metastore 호환 메타데이터 저장소. Athena·Redshift Spectrum·EMR·SageMaker가 공유한다.
- Crawler가 S3를 스캔해 스키마·파티션을 자동 추론하고 카탈로그에 테이블을 만든다.
- Glue ETL Job은 서버리스 Spark 변환. 과금 단위는 DPU × 실행 시간. 작은 데이터엔 Python Shell이 유리하다.
- DataBrew는 노코드 GUI 데이터 준비 도구. "비기술 사용자", "시각적 프로파일링" 키워드면 정답.
- 표준 흐름은 Raw(JSON/CSV) → Crawler·Catalog → ETL/DataBrew → Curated(Parquet, 파티셔닝).
S3에 객체를 던져 넣는 것만으로는 분석도 학습도 할 수 없다. "이 버킷에 무슨 데이터가, 어떤 스키마로 들어 있는가"를 알아야 Athena로 쿼리하고 SageMaker로 학습할 수 있다.
Glue Data Catalog는 Hive Metastore 호환 메타데이터 저장소다. 데이터 자체가 아니라 데이터에 대한 정보 — 테이블 이름, 컬럼, 타입, S3 위치, 파티션 — 를 저장한다.