- S3가 ML 데이터의 단일 진실 공급원이다. 학습·ETL·쿼리가 모두 S3를 입출력으로 삼는다.
- 데이터 레이크는 Raw → Cleaned → Curated 존으로 계층화한다(메달리온 아키텍처). 원본은 절대 덮어쓰지 않는다.
- 실시간 수집은 Kinesis — 관리 부담 최소 + S3 적재면 Firehose, 저지연 + 다중 소비자면 Data Streams.
- 배치 수집은 DataSync(파일)·DMS(DB 복제/CDC)·Transfer Family(SFTP)·Snowball(회선이 비현실적일 때).
- 학습 데이터 포맷의 기본값은 Parquet — 열 기반이라 필요한 컬럼만 읽고, 압축률이 높고, 분할 가능하다.
머신러닝 파이프라인의 첫 관문은 "데이터를 어디서, 어떻게 가져오는가"다. MLA-C01 도메인 1(Data Preparation)이 전체의 약 28%를 차지하는데 그 출발점이 수집(ingestion)이다.
AWS에서 ML 데이터의 사실상 단일 진실 공급원(single source of truth)은 Amazon S3다. SageMaker의 학습 잡, Glue의 ETL, Athena의 쿼리가 모두 S3를 입출력으로 사용한다. 이유는 셋이다.
- 사실상 무제한 용량: 객체 하나당 최대 5TB, 버킷당 객체 수 제한 없음. 페타바이트 규모 학습 데이터도 수용.
2