Cert Notes/ 출퇴근 학습 노트
로드맵
KOEN
CLF-C02 · FoundationalCloud Practitioner - Foundational
DVA-C02 · AssociateDeveloper - Associate
SAA-C03 · AssociateSolutions Architect - Associate
SOA-C02 · AssociateCloudOps Engineer - Associate
SAP-C02 · ProfessionalSolutions Architect - Professional
DOP-C02 · ProfessionalDevOps Engineer - Professional
SCS-C03 · SpecialtySecurity - Specialty
MLA-C01 · AssociateMachine Learning Engineer - Associate
AIF-C01 · FoundationalAI Practitioner - Foundational
DEA-C01 · AssociateData Engineer - Associate
MLS-C01 · SpecialtyMachine Learning - Specialty
  • Week 1
    • 1.ML Lifecycle (Specialty Perspective)
    • 2.ML용 데이터 저장소: S3·EFS·FSx for Lustre·데이터 포맷
    • 3.데이터 수집: Kinesis·Glue·배치 vs 스트리밍
    • 4.Data Labeling: SageMaker Ground Truth·Active Learning·Label Quality
    • 5.Week 1 Integrated Review: ML Overview & Data Engineering 1
  • Week 2
    • 1.데이터 변환과 ETL: AWS Glue, Spark, 그리고 EMR
    • 2.학습 데이터 파이프라인 자동화: Step Functions와 SageMaker Pipelines
    • 3.Data Augmentation and Synthesis: Addressing Insufficient and Imbalanced Data
    • 4.Data Storage and Access Optimization: Pipe vs File Mode, FSx for Lustre, Distributed Training
    • 5.Week 2 Comprehensive Review: From Transformation to Distributed Training Data Supply
  • Week 3
    • 1.Data Cleaning: Missing Values, Outlier Detection, Duplicates and Errors
    • 2.특성 공학: 스케일링, 인코딩, 비닝
    • 3.Time Series, Text Features, and High-Cardinality Categorical Handling
    • 4.SageMaker 도구: Data Wrangler, Processing Job, Feature Store
    • 5.Week 3 Comprehensive Review: Cleaning and Feature Engineering
  • Week 4
    • 1.차원 축소: PCA, t-SNE, 차원의 저주
    • 2.Feature Selection: Filter, Wrapper, Embedded, Importance, Multicollinearity
    • 3.Data Visualization: Distribution, Correlation, QuickSight, Insights
    • 4.Handling Class Imbalance: Over/Undersampling, SMOTE, Class Weights, Evaluation
    • 5.Week 4 Comprehensive Review: Dimensionality, Feature Selection, Visualization, Imbalance
  • Week 5
    • 1.Statistical Foundations: Distribution, Central Tendency, Dispersion, Transformations, Sample and Population
    • 2.Correlation and Relationships: Correlation Coefficients, Causation vs. Correlation, Multivariate Relationships
    • 3.Data Leakage: Causes, Detection, Prevention; Time Series Leakage; Target Leakage
    • 4.Validation Design: train/validation/test Split, Cross-Validation, Time Series Split, Stratified Sampling
    • 5.Week 5 Comprehensive Review: Statistics and Validation Design
  • Week 6
    • 1.알고리즘 선택: 문제 유형별 매핑
    • 2.SageMaker Builtin 1: XGBoost, Linear Learner, K-Means, KNN
    • 3.SageMaker Builtin 2: Text, Image, Time Series, Recommendation
    • 4.Unsupervised/Anomaly Detection: RCF, PCA, IP Insights, Topic Models (LDA/NTM)
    • 5.Week 6 Comprehensive Review: Algorithm Selection and SageMaker Builtins
  • Week 7
    • 1.신경망 기초: 퍼셉트론에서 역전파까지
    • 2.CNN: Convolutional Neural Networks and Computer Vision
    • 3.RNNs and Sequences: From LSTM to Transformer
    • 4.학습 기법과 전이학습
    • 5.Week 7 Synthesis: Deep Learning Summary
  • Week 8
    • 1.SageMaker 학습 작업: Estimator, 입력 모드, 분산 학습, Spot
    • 2.하이퍼파라미터 튜닝(AMT): 베이지안·랜덤·Hyperband
    • 3.Overfitting/Underfitting: Diagnosis and Regularization/Data Augmentation
    • 4.학습 최적화: 배치 크기·학습률, 그래디언트 문제, Debugger/Profiler
    • 5.Week 8 Review: Training, Tuning, Generalization
  • Week 9
    • 1.분류 평가지표: 정확도·정밀도·재현율·F1과 혼동행렬
    • 2.ROC/AUC와 임계값 조정: 곡선으로 읽는 모델 성능
    • 3.회귀 평가지표: RMSE·MAE·MAPE·R²와 잔차 분석
    • 4.모델 디버깅과 편향: SageMaker Debugger와 Clarify
    • 5.Week 9 종합 복습: 평가와 디버깅
  • Week 10
    • 1.추론 옵션: 실시간 vs 서버리스 vs 비동기 vs 배치 변환
    • 2.Real-time Endpoint Operations: Configuration, Auto Scaling, Multi-Model
    • 3.Inference Optimization: Neo, Elastic Inference, Inferentia, Inference Pipelines
    • 4.Deployment Strategies: A/B Testing, Blue/Green, Canary, Shadow, Rollback
    • 5.Week 10 Review: ML Implementation & Operations 1 — Deployment & Inference
  • Week 11
    • 1.Model Monitoring: SageMaker Model Monitor and Drift Response
    • 2.MLOps: SageMaker Pipelines, Model Registry, CI/CD
    • 3.ML Security: IAM Execution Roles, VPC Isolation, KMS Encryption
    • 4.Operations & Cost: Cost Optimization, Logging/Audit, Disaster Recovery
    • 5.Week 11 Review: Monitoring, MLOps, Security, Operations
  • Week 12
    • 1.도메인 1·2 통합 복습: 데이터 엔지니어링 + 탐색적 데이터 분석
    • 2.도메인 3 통합 복습: 모델링(알고리즘·딥러닝·튜닝·평가)
    • 3.도메인 4 + 전체 종합: ML 구현·운영 복습 + 4도메인 교차
    • 4.Synthesis: 4 Domains + End-to-End Scenarios
    • 5.D-Day 마무리: 시험 구성·시간 배분·요구사항 번역표·함정 총정리
합격 후기
← MLS-C01/Week 1/Day 5
MLS-C01· AssociateWeek 1 · Day 5읽기 약 14분

Day 5 - Week 1 Integrated Review: ML Overview & Data Engineering 1

📌 핵심 정리

  • Week 1은 **수명주기(Day 1) → 저장(Day 2) → 수집(Day 3) → 레이블링(Day 4)**을 하나의 데이터 파이프라인으로 잇는다.
  • 파이프라인 전체를 관통하는 원칙은 재현성과 training-serving skew 방지 두 가지다.
  • 입력 모드·포맷·수집 서비스·워크포스는 모두 상황에 따른 선택이지 절대적 정답이 없다. 지문의 단서를 찾아 매핑하는 훈련이 핵심이다.
  • 불균형 데이터에서 accuracy는 함정이다. 미탐 비용이 크면 recall, 극단 불균형이면 PR-AUC.
  • 제약이 충돌하는 시나리오는 모든 제약을 동시에 만족하는 선택이 정답이다. 하나만 어겨도 오답.

데이터 엔지니어링 파이프라인 한눈에 보기

이번 주 내용은 다음 흐름으로 이어진다.

[Source]  클릭 로그 · IoT · 거래 이벤트  ──┐
                                          ▼
[Ingest]  스트림? → Kinesis (Firehose=적재 / KDS=다소비자·replay)   (Day 3)
          배치?   → Glue ETL / EMR / Batch
                                          ▼
[Store]   S3 데이터레이크 (Parquet / RecordIO)                     (Day 2)
                                          ▼
[Label]   SageMaker Ground Truth (워크포스 + 액티브 러닝 + 합의)    (Day 4)
                                          ▼
[Features] Glue·Processing으로 피처 엔지니어링 → Feature Store
                                          ▼
[Train I/O] S3 (Pipe/File/FastFile) | EFS | FSx for Lustre        (Day 2)
                                          ▼
[Model]   학습 → 평가(비즈니스 지표 연결) → 배포 → 모니터링         (Day 1)
                                          └──── 드리프트 → 루프백 ────┘

💡 개념: 이 파이프라인 전체를 관통하는 하나의 원칙은 재현성과 training-serving skew 방지다. 수집·정제·피처 로직을 코드에 고정하고, 데이터를 버전 관리하고, 학습과 추론에서 동일한 변환을 쓴다. 노트북에서 즉흥적으로 만든 피처나 출처 불명 데이터는 운영에서 조용히 모델을 망가뜨린다.

핵심 판단 기준 총정리

시험에서 헷갈리는 결정들을 압축한다.

스토리지 입력 모드 (Day 2)

상황선택
대용량, 순차 접근, 빠른 시작Pipe 모드
소량, 랜덤 접근, 단순함 우선File 모드
대용량인데 일부만·랜덤 접근FastFile 모드
반복 읽기, 고처리량 공유 접근FSx for Lustre
범용 공유 파일 시스템EFS

데이터 포맷 (Day 2)

상황선택
정형 데이터 분석·ETL, 일부 컬럼만Parquet (컬럼형)
SageMaker 내장 알고리즘, 대용량 순차RecordIO-protobuf
작은 파일 수백만 개샤딩으로 통합
스키마가 들쭉날쭉한 로그 원본JSON Lines → Glue로 정형화

수집 서비스 (Day 3)

상황선택
코드 없이 S3 등으로 배달Kinesis Data Firehose
다소비자, 재처리(replay), 커스텀 처리Kinesis Data Streams
실시간 집계·이상 탐지Managed Service for Flink
스키마 추론, 카탈로그화Glue Crawler
서버리스 Spark ETLGlue ETL Job

레이블링 (Day 4)

상황선택
민감·규제 데이터Private 또는 Vendor 워크포스
공개·대규모·저비용Mechanical Turk
레이블링 비용 절감액티브 러닝(automated labeling)
무작위 레이블러 오류 감소합의(다수 레이블러 + 통합)
전원이 같은 방향으로 틀림지침 명확화 + golden set

빠른 복습: 평가 지표 (Day 1)

# 분류 지표 결정 트리 (의사코드)
if 클래스가_극단적으로_불균형:
    if 미탐_비용이_큼 (사기, 질병):          → recall 우선, PR-AUC로 비교
    elif 오탐_비용이_큼 (스팸, 마케팅):      → precision 우선
    else:                                    → PR-AUC
else:
    if 임계값_미정:                          → ROC-AUC
    else:                                    → F1 / accuracy
지표한 줄 요약이 지표가 답이 되는 단서
Accuracy전체 정답률"클래스가 균형" 명시가 있을 때만
Precision오탐이 적은가"정상 메일을 막으면 안 된다", "발송 비용"
Recall미탐이 적은가"놓치면 치명적", "사기·질병"
F1둘의 균형두 비용이 비슷하다는 서술
ROC-AUC임계값 무관 분별력"임계값을 아직 못 정했다", "모델 비교"
PR-AUC소수 클래스 분별력"양성이 0.1%", "극단적 불균형"
RMSE / MAE회귀 오차연속값 예측, 이상치 민감도 언급

💡 개념: 항상 단일 지표 함정을 경계하라. 불균형 데이터에서 accuracy 99.9%는 "전부 음성" 모델일 수 있다. 오프라인 지표는 배포를 통과시키는 게이트이고, 온라인 비즈니스 지표(A/B 테스트)가 최종 판정을 내린다. 이 2단 구조를 기억하면 Day 1의 요지를 잡은 것이다.

미니 통합 시나리오

시나리오: 글로벌 이커머스가 실시간 클릭 스트림에서 사기 거래를 탐지하려 한다. 과거 사기 레이블이 매우 희소하고, 사기는 전체 거래의 0.1%다. 데이터에는 PII가 포함된다.

단계별 풀이 흐름:

  1. 수집 — 다소비자와 재처리가 필요하므로 Kinesis Data Streams + Flink로 실시간 피처, 동시에 Firehose로 S3 적재(람다 아키텍처).
  2. 저장 — S3 데이터레이크에 Parquet로.
  3. 레이블링 — PII가 있으므로 Private 워크포스. 레이블이 매우 희소하므로 액티브 러닝으로 효율화하거나, seed조차 너무 적으면 비지도 이상 탐지(Random Cut Forest)로 출발.
  4. 평가 — 0.1% 불균형 + 미탐 비용 큼 → recall 우선, PR-AUC로 비교.
  5. 배포 — 소량 트래픽 A/B로 먼저 검증한 뒤 확대, 드리프트 모니터링.

이 한 시나리오에 Week 1의 모든 개념이 들어 있다. 각 결정의 근거를 말로 설명할 수 있으면 이번 주를 소화한 것이다.

💡 개념: 제약 충돌형 시나리오에서는 제약이 먼저다. PII가 워크포스를 강제하고, 극단적 불균형이 지표를 강제하고, 다소비자 요건이 KDS를 강제한다. 정답은 가장 화려한 기술이 아니라 모든 제약을 동시에 만족하는 선택이다. 하나라도 위반하면(예: PII를 공개 워크포스에) 다른 장점과 무관하게 오답이다.

⚠️ 함정: 보기 중 "가장 최신 서비스", "가장 저렴한 옵션", "가장 단순한 구성"이 눈에 띄어도 제약을 어기면 전부 오답이다. 제약 → 후보 소거 → 남은 것 중 비용·운영 부담 비교, 이 순서를 지켜라.

헷갈리는 짝 비교

헷갈리는 짝결정적 차이
KDS vs Firehose보관·재생·다소비자 vs 코드 없는 단순 적재
Glue Crawler vs Glue ETL Job스키마 추론·카탈로그 등록 vs 실제 데이터 변환
File vs Pipe vs FastFile전체 복사 후 시작 vs 스트리밍 즉시 시작 vs 둘의 절충
FullyReplicated vs ShardedByS3Key전 노드 전체 복제 vs 노드별 조각 분배
EFS vs FSx for Lustre범용 공유·설정 단순 vs 고처리량 반복 읽기
Parquet vs RecordIO-protobuf정형 분석·컬럼 선택 vs 내장 알고리즘 순차 스트리밍
Mechanical Turk vs Private/Vendor공개 대량 저비용 vs 민감 데이터·전문성
합의(consensus) vs golden set무작위 오류 상쇄 vs 체계적 편향·지침 검증
ROC-AUC vs PR-AUC일반적 분별력 vs 극단 불균형에서의 정직함
배치 vs 스트리밍주기적·정확·단순 vs 즉시성·운영 난이도 높음

Week 1 오답 노트

시험에서 반복해 걸려 넘어지는 지점만 모았다.

  • accuracy를 고르는 습관 — 지문에 "0.1%", "희소", "불균형"이 보이면 즉시 버린다.
  • "실시간이니까 KDS" — 소비자가 하나이고 적재만 하면 Firehose가 정답이다.
  • "데이터가 크니까 EMR/큰 클러스터" — 산발적이고 운영 인력이 적으면 서버리스 쪽이 맞다.
  • 샤딩을 켰는데 효과가 없다 — 데이터가 단일 거대 파일이면 객체 단위 분배가 일어나지 않는다.
  • 민감 데이터에 Mechanical Turk — 단가만 보고 고르면 컴플라이언스 위반이다.
  • 레이블이 없는데 지도학습 분류를 고름 — 레이블 가용성이 문제 유형을 바꾼다.
  • 오프라인 지표만 보고 전량 배포 — 소량 트래픽 A/B로 온라인 지표를 먼저 확인해야 한다.
  • Glue Crawler에 변환을 기대함 — Crawler는 스키마만 등록하고 데이터를 옮기거나 바꾸지 않는다.

스스로 점검하기

머릿속으로 답해 보자.

  1. 수백 GB를 4대에 분산 학습하며 GPU 유휴를 줄이려면? → Pipe 모드 + ShardedByS3Key
  2. 같은 데이터셋으로 HPO를 200회 반복한다면? → FSx for Lustre
  3. 50개 컬럼 중 3개만 반복해서 읽는다면? → Parquet
  4. 여러 팀이 같은 스트림을 독립 소비하고 재처리도 필요하다면? → Kinesis Data Streams
  5. 스키마를 모르는 JSON 로그를 Athena로 보려면 먼저? → Glue Crawler
  6. 환자 X-ray 50만 장의 워크포스는? → Private 또는 Vendor
  7. 레이블링 예산이 빠듯할 때 첫 수단은? → 액티브 러닝
  8. 양성 0.1%에서 가장 정직한 단일 지표는? → PR-AUC

Week 1 서비스 지도

이번 주에 등장한 서비스를 역할별로 한 장에 모았다. 시험에서 서비스 이름만 보고 자리를 떠올릴 수 있어야 한다.

역할서비스한 줄
스트림 수집Kinesis Data Streams샤드 기반, 보관·재생·다소비자
스트림 적재Kinesis Data Firehose코드 없이 S3 등으로 배달, 포맷 변환
스트림 분석Managed Service for Flink윈도우 집계, 실시간 이상 탐지
영상 수집Kinesis Video Streams영상 ML 입력
Kafka 대안Amazon MSK관리형 Kafka
DB 수집AWS DMS마이그레이션 + CDC
파일 전송AWS DataSync / Snow 패밀리온라인 대량 전송 / 오프라인 물리 전송
메타데이터Glue Data Catalog스키마·위치·파티션 중앙 저장소
스키마 추론Glue Crawler훑어서 테이블 등록
서버리스 ETLGlue ETL JobSpark 기반 변환
SQL 탐색Amazon Athena카탈로그 기반 즉석 조회
객체 저장Amazon S3데이터레이크의 기본
공유 파일Amazon EFS관리형 NFS, 다중 마운트
고성능 파일FSx for Lustre반복·고처리량 학습 I/O
레이블링SageMaker Ground Truth워크포스 + 액티브 러닝 + 합의
사람 검토Amazon A2I운영 중 저신뢰 예측의 사람 검토
전처리 실행SageMaker Processing관리형 분산 전처리 잡
이상 탐지Random Cut Forest레이블 없이 이상 점수 산출

지문에서 단서 찾기

Specialty 지문은 정답을 가리키는 단어를 반드시 심어 둔다. 아래 매핑을 외워 두면 소거가 빨라진다.

지문의 표현즉시 떠올릴 것
"운영 인력이 적다", "관리 부담 최소"서버리스(Firehose, Glue)
"여러 팀이 각자 소비", "재처리 필요"Kinesis Data Streams
"코드 없이", "자동 배달"Kinesis Data Firehose
"스키마를 모른다"Glue Crawler → Data Catalog → Athena
"GPU가 데이터를 기다린다"Pipe/FastFile 모드, FSx for Lustre
"같은 데이터로 수백 번 튜닝"FSx for Lustre
"50개 컬럼 중 몇 개만"Parquet
"작은 파일 수백만 개"샤딩으로 통합
"PII", "환자", "규제"Private 또는 Vendor 워크포스
"레이블링 예산이 빠듯"액티브 러닝, 전이학습
"양성이 0.1%"PR-AUC, recall
"밀리초 응답"실시간 엔드포인트(서버리스 아님)
"야간 일괄 채점"배치 변환

다음 주 예고

Week 2는 Data Engineering 2로 들어간다. EMR과 Spark를 이용한 대규모 처리, 데이터 변환·정제 심화, 결측치·이상치·불균형 데이터 처리, 그리고 특성 공학 기법 전반을 다룬다. 이번 주 파이프라인에서 "Features" 단계를 확대해 들여다보는 셈이다.

📖 용어

  • 데이터레이크 : 정형·비정형 데이터를 원본 그대로 대량 저장해 두는 중앙 저장소. 보통 S3 위에 만든다.
  • 재현성(reproducibility) : 같은 입력과 같은 코드면 언제 돌려도 같은 결과가 나오는 성질.
  • training-serving skew : 학습 때와 추론 때 피처 계산이 달라 운영 성능이 떨어지는 사고.
  • 드리프트(drift) : 운영 중 데이터 분포가 변해 모델 성능이 서서히 나빠지는 현상. 재학습 트리거의 근거.
  • 입력 모드 : S3 데이터를 학습 컨테이너로 가져오는 방식. File·Pipe·FastFile.
  • ShardedByS3Key : 인스턴스마다 S3 객체의 다른 조각만 받게 하는 분배 설정.
  • replay(재생) : 스트림에 보관된 데이터를 처음부터 다시 읽어 재처리하는 것.
  • 액티브 러닝 : 모호한 샘플만 사람에게 보내 레이블링 비용을 줄이는 전략.
  • PR-AUC : precision-recall 곡선 아래 면적. 양성이 극히 적을 때 가장 정직한 지표.
  • 제약 충돌 시나리오 : 규제·불균형·다소비자 같은 조건이 동시에 걸린 문제. 모든 제약을 만족하는 답을 골라야 한다.

📝 연습 문제

선택지를 클릭하면 정답·해설이 펼쳐집니다.

문제 1

거래의 0.1%만 사기이고 미탐 비용이 큰 사기 탐지 모델의 성능을 비교한다. 가장 정직한 단일 지표는?

문제 2

수백 GB 데이터를 여러 인스턴스로 분산 학습하며 GPU 유휴를 최소화하고 인스턴스마다 다른 데이터 조각만 읽게 하려면?

문제 3

PII가 포함된 의료 데이터를 레이블링하면서 레이블링 인건비도 줄이고 싶다. 가장 적절한 조합은?

문제 4

하나의 이벤트 스트림을 실시간 대시보드·사기 모델·추후 재처리에 독립적으로 쓰고 장애 시 재생도 필요하다. 적합한 수집 서비스는?

문제 5

여러 제약(민감 데이터, 극단적 불균형, 다소비 스트림)이 동시에 걸린 시나리오 문제를 풀 때 가장 올바른 접근은?

이전Data Labeling: SageMaker Ground Truth·Active Learning·Label QualityWeek 1 · Day 4다음 데이터 변환과 ETL: AWS Glue, Spark, 그리고 EMRWeek 2 · Day 1

이 페이지

  • 핵심 정리
  • 데이터 엔지니어링 파이프라인 한눈에 보기
  • 핵심 판단 기준 총정리
  • 빠른 복습: 평가 지표 (Day 1)
  • 미니 통합 시나리오
  • 헷갈리는 짝 비교
  • Week 1 오답 노트
  • 스스로 점검하기
  • Week 1 서비스 지도
  • 지문에서 단서 찾기
  • 다음 주 예고
  • 용어
  • 연습 문제