Cert Notes/ 출퇴근 학습 노트
로드맵
KOEN
CLF-C02 · FoundationalCloud Practitioner - Foundational
DVA-C02 · AssociateDeveloper - Associate
SAA-C03 · AssociateSolutions Architect - Associate
SOA-C02 · AssociateCloudOps Engineer - Associate
SAP-C02 · ProfessionalSolutions Architect - Professional
DOP-C02 · ProfessionalDevOps Engineer - Professional
SCS-C03 · SpecialtySecurity - Specialty
MLA-C01 · AssociateMachine Learning Engineer - Associate
AIF-C01 · FoundationalAI Practitioner - Foundational
DEA-C01 · AssociateData Engineer - Associate
  • Week 1
    • 1.데이터 엔지니어링이란
    • 2.배치 vs 스트리밍
    • 3.AWS 데이터 서비스 조감도
    • 4.데이터 포맷과 모델링
    • 5.Week 1 종합 복습
  • Week 2
    • 1.배치 수집: S3 업로드, DataSync, Transfer Family, Snow
    • 2.Kinesis Data Streams: 샤드, 파티션 키, 처리량
    • 3.Kinesis Data Firehose: 전달 스트림과 적재
    • 4.Amazon MSK(Kafka): 토픽, 파티션, 언제 무엇
    • 5.Week 2 종합: 데이터 수집 1 복습
  • Week 3
    • 1.스트리밍 처리: Managed Service for Apache Flink와 윈도우 집계
    • 2.수집 신뢰성: 멱등성, 순서 보장, 재시도, 중복 제거, DLQ
    • 3.CDC와 데이터 복제: Database Migration Service(DMS)
    • 4.수집 아키텍처 패턴: Lambda 아키텍처와 이벤트 기반 수집
    • 5.Week 3 종합: 데이터 수집 2 복습
  • Week 4
    • 1.Glue Data Catalog와 크롤러: 데이터에 메타데이터를 입히다
    • 2.Glue ETL Job: Spark 위에서 데이터를 변환하다
    • 3.Glue Studio와 DataBrew: 코드 없이 변환하기
    • 4.스키마 관리와 데이터 품질: 진화를 견디고 신뢰를 보장하다
    • 5.Week 4 종합: AWS Glue 변환의 큰 그림
  • Week 5
    • 1.Amazon EMR: Spark·Hive와 클러스터 운영, 그리고 EMR Serverless
    • 2.Lambda 변환과 경량 처리: 이벤트 기반 ETL의 한계와 적합성
    • 3.오케스트레이션: Step Functions·MWAA·Glue Workflows의 선택 기준
    • 4.성능·비용 최적화: 파일 포맷·압축·파티셔닝과 작은 파일 문제
    • 5.Week 5 종합: 데이터 변환 2 — 엔진·오케스트레이션·최적화 통합 복습
  • Week 6
    • 1.S3 데이터레이크 레이아웃과 파티셔닝 전략
    • 2.AWS Lake Formation 중앙 권한 관리
    • 3.오픈 테이블 포맷: Iceberg, Hudi, Delta Lake
    • 4.S3 스토리지 관리와 비용 최적화
    • 5.Week 6 종합: 데이터레이크 복습
  • Week 7
    • 1.Amazon Redshift: 분산/정렬 키와 워크로드 최적화
    • 2.Amazon Athena: 서버리스 쿼리와 비용 최적화
    • 3.DynamoDB (분석 관점): 키 설계와 스트림 기반 파이프라인
    • 4.RDS/Aurora & 스토어 선택: OLTP, 제로 ETL, 워크로드→스토어 결정
    • 5.Week 7 종합: 분석 스토어 복습
  • Week 8
    • 1.파이프라인 모니터링: CloudWatch 지표·로그·알람
    • 2.데이터 품질·검증: Glue Data Quality와 검증 게이트
    • 3.로깅·감사·트러블슈팅: CloudTrail과 실패 복구
    • 4.비용·성능 운영: 모니터링, 사이징, 자동 스케일링
    • 5.Week 8 종합: 데이터 운영 및 지원 복습
  • Week 9
    • 1.접근 제어: IAM과 Lake Formation 권한
    • 2.암호화: KMS와 서비스별 암호화
    • 3.민감 데이터 보호: Macie와 마스킹
    • 4.데이터 거버넌스: 카탈로그·계보·공유·감사
    • 5.Week 9 종합: 보안·거버넌스 복습
  • Week 10
    • 1.도메인 1·2 통합 복습: 수집·변환 + 스토어 관리
    • 2.도메인 3·4 통합 복습: 운영·지원 + 보안·거버넌스
    • 3.전체 모의고사 페이스: 4개 도메인 종합 시나리오
    • 4.자주 틀리는 함정과 키워드: "요구사항 → 서비스" 번역표
    • 5.D-Day 마무리: 시험 구성, 시간 배분, 시나리오 분해 전략
MLS-C01 · SpecialtyMachine Learning - Specialty
합격 후기
← DEA-C01/Week 3/Day 2
DEA-C01· AssociateWeek 3 · Day 2읽기 약 10분

Day 2 - 수집 신뢰성: 멱등성, 순서 보장, 재시도, 중복 제거, DLQ

분산 시스템에서 "메시지가 정확히 한 번 전달된다"는 보장은 사실상 환상에 가깝다. 네트워크는 끊기고, 노드는 죽고, 응답은 유실된다. 프로듀서가 메시지를 보냈는데 응답(ACK)을 못 받으면, 그 메시지가 도착했는지 안 했는지 알 수 없다. 다시 보내면 중복이 생기고, 안 보내면 유실된다. 이 딜레마가 데이터 수집 신뢰성의 출발점이다.

현실적인 분산 시스템은 대부분 **At-least-once(최소 한 번)**를 보장한다. "유실보다는 중복이 낫다"는 선택이다. 그렇다면 중복을 누가 처리할 것인가? 답은 컨슈머가 멱등성(idempotency)을 갖추는 것이다. 오늘은 이 신뢰성을 구성하는 다섯 개의 축 — 멱등성, 순서, 재시도, 중복 제거, DLQ — 을 다룬다.

전달 보장의 세 등급: 무엇을 선택할 것인가

보장의미비용/복잡도대표
At-most-once최대 한 번, 유실 가능가장 단순재시도 없는 UDP 류
At-least-once최소 한 번, 중복 가능중간SQS Standard, Kinesis
Exactly-once정확히 한 번가장 비쌈SQS FIFO(범위 한정), Flink(상태)

진정한 end-to-end exactly-once는 매우 비싸고, 보통 "at-least-once 전달 + 멱등한 컨슈머"의 조합으로 같은 효과를 낸다

여기부터는 Pro 전용입니다

Week 1은 누구나 무료로 볼 수 있어요. Week 2부터의 전체 학습 자료와 모의고사·무제한 복습은 Pro 플랜에서 이용할 수 있습니다.

Pro 알아보기로그인
이전스트리밍 처리: Managed Service for Apache Flink와 윈도우 집계Week 3 · Day 1다음 CDC와 데이터 복제: Database Migration Service(DMS)Week 3 · Day 3