Cert Notes/ 출퇴근 학습 노트
로드맵
KOEN
CLF-C02 · FoundationalCloud Practitioner - Foundational
DVA-C02 · AssociateDeveloper - Associate
SAA-C03 · AssociateSolutions Architect - Associate
SOA-C02 · AssociateCloudOps Engineer - Associate
SAP-C02 · ProfessionalSolutions Architect - Professional
DOP-C02 · ProfessionalDevOps Engineer - Professional
SCS-C03 · SpecialtySecurity - Specialty
MLA-C01 · AssociateMachine Learning Engineer - Associate
AIF-C01 · FoundationalAI Practitioner - Foundational
DEA-C01 · AssociateData Engineer - Associate
MLS-C01 · SpecialtyMachine Learning - Specialty
  • Week 1
    • 1.ML Lifecycle (Specialty Perspective)
    • 2.ML용 데이터 저장소: S3·EFS·FSx for Lustre·데이터 포맷
    • 3.데이터 수집: Kinesis·Glue·배치 vs 스트리밍
    • 4.Data Labeling: SageMaker Ground Truth·Active Learning·Label Quality
    • 5.Week 1 Integrated Review: ML Overview & Data Engineering 1
  • Week 2
    • 1.데이터 변환과 ETL: AWS Glue, Spark, 그리고 EMR
    • 2.학습 데이터 파이프라인 자동화: Step Functions와 SageMaker Pipelines
    • 3.Data Augmentation and Synthesis: Addressing Insufficient and Imbalanced Data
    • 4.Data Storage and Access Optimization: Pipe vs File Mode, FSx for Lustre, Distributed Training
    • 5.Week 2 Comprehensive Review: From Transformation to Distributed Training Data Supply
  • Week 3
    • 1.Data Cleaning: Missing Values, Outlier Detection, Duplicates and Errors
    • 2.특성 공학: 스케일링, 인코딩, 비닝
    • 3.Time Series, Text Features, and High-Cardinality Categorical Handling
    • 4.SageMaker 도구: Data Wrangler, Processing Job, Feature Store
    • 5.Week 3 Comprehensive Review: Cleaning and Feature Engineering
  • Week 4
    • 1.차원 축소: PCA, t-SNE, 차원의 저주
    • 2.Feature Selection: Filter, Wrapper, Embedded, Importance, Multicollinearity
    • 3.Data Visualization: Distribution, Correlation, QuickSight, Insights
    • 4.Handling Class Imbalance: Over/Undersampling, SMOTE, Class Weights, Evaluation
    • 5.Week 4 Comprehensive Review: Dimensionality, Feature Selection, Visualization, Imbalance
  • Week 5
    • 1.Statistical Foundations: Distribution, Central Tendency, Dispersion, Transformations, Sample and Population
    • 2.Correlation and Relationships: Correlation Coefficients, Causation vs. Correlation, Multivariate Relationships
    • 3.Data Leakage: Causes, Detection, Prevention; Time Series Leakage; Target Leakage
    • 4.Validation Design: train/validation/test Split, Cross-Validation, Time Series Split, Stratified Sampling
    • 5.Week 5 Comprehensive Review: Statistics and Validation Design
  • Week 6
    • 1.알고리즘 선택: 문제 유형별 매핑
    • 2.SageMaker Builtin 1: XGBoost, Linear Learner, K-Means, KNN
    • 3.SageMaker Builtin 2: Text, Image, Time Series, Recommendation
    • 4.Unsupervised/Anomaly Detection: RCF, PCA, IP Insights, Topic Models (LDA/NTM)
    • 5.Week 6 Comprehensive Review: Algorithm Selection and SageMaker Builtins
  • Week 7
    • 1.신경망 기초: 퍼셉트론에서 역전파까지
    • 2.CNN: Convolutional Neural Networks and Computer Vision
    • 3.RNNs and Sequences: From LSTM to Transformer
    • 4.학습 기법과 전이학습
    • 5.Week 7 Synthesis: Deep Learning Summary
  • Week 8
    • 1.SageMaker 학습 작업: Estimator, 입력 모드, 분산 학습, Spot
    • 2.하이퍼파라미터 튜닝(AMT): 베이지안·랜덤·Hyperband
    • 3.Overfitting/Underfitting: Diagnosis and Regularization/Data Augmentation
    • 4.학습 최적화: 배치 크기·학습률, 그래디언트 문제, Debugger/Profiler
    • 5.Week 8 Review: Training, Tuning, Generalization
  • Week 9
    • 1.분류 평가지표: 정확도·정밀도·재현율·F1과 혼동행렬
    • 2.ROC/AUC와 임계값 조정: 곡선으로 읽는 모델 성능
    • 3.회귀 평가지표: RMSE·MAE·MAPE·R²와 잔차 분석
    • 4.모델 디버깅과 편향: SageMaker Debugger와 Clarify
    • 5.Week 9 종합 복습: 평가와 디버깅
  • Week 10
    • 1.추론 옵션: 실시간 vs 서버리스 vs 비동기 vs 배치 변환
    • 2.Real-time Endpoint Operations: Configuration, Auto Scaling, Multi-Model
    • 3.Inference Optimization: Neo, Elastic Inference, Inferentia, Inference Pipelines
    • 4.Deployment Strategies: A/B Testing, Blue/Green, Canary, Shadow, Rollback
    • 5.Week 10 Review: ML Implementation & Operations 1 — Deployment & Inference
  • Week 11
    • 1.Model Monitoring: SageMaker Model Monitor and Drift Response
    • 2.MLOps: SageMaker Pipelines, Model Registry, CI/CD
    • 3.ML Security: IAM Execution Roles, VPC Isolation, KMS Encryption
    • 4.Operations & Cost: Cost Optimization, Logging/Audit, Disaster Recovery
    • 5.Week 11 Review: Monitoring, MLOps, Security, Operations
  • Week 12
    • 1.도메인 1·2 통합 복습: 데이터 엔지니어링 + 탐색적 데이터 분석
    • 2.도메인 3 통합 복습: 모델링(알고리즘·딥러닝·튜닝·평가)
    • 3.도메인 4 + 전체 종합: ML 구현·운영 복습 + 4도메인 교차
    • 4.Synthesis: 4 Domains + End-to-End Scenarios
    • 5.D-Day 마무리: 시험 구성·시간 배분·요구사항 번역표·함정 총정리
합격 후기
← MLS-C01/Week 1/Day 4
MLS-C01· AssociateWeek 1 · Day 4읽기 약 12분

Day 4 - Data Labeling: SageMaker Ground Truth·Active Learning·Label Quality

📌 핵심 정리

  • 지도학습 모델의 천장은 알고리즘이 아니라 레이블 품질이 정한다. "garbage in, garbage out".
  • Ground Truth 레이블링 잡은 입력 데이터 · 작업 유형 · 워크포스 · UI 템플릿 네 가지로 구성된다.
  • 워크포스는 민감 데이터면 Private 또는 Vendor, 공개·대량·저비용이면 Mechanical Turk. 민감 데이터에 MTurk는 항상 오답.
  • 액티브 러닝(automated data labeling) — 모델이 확신하는 건 자동 레이블, 모호한 것만 사람에게 → 비용 절감의 정석.
  • **합의(consensus)**는 무작위 오류를 줄이지만 체계적 편향은 못 잡는다. 명확한 지침과 golden set이 필요하다.

SageMaker Ground Truth: 레이블링 워크플로

수십만 장을 사람이 손으로 레이블링하는 비용은 감당하기 어렵다. Specialty는 "이걸 어떻게 싸고 정확하게 붙이는가"를 묻고, 답의 중심에 Ground Truth가 있다.

Ground Truth는 레이블링 잡을 네 조각으로 구성한다.

구성 요소내용
입력 데이터S3의 매니페스트(JSON Lines)로 지정
작업 유형이미지 분류, 바운딩 박스, 시맨틱 세그멘테이션, 텍스트 분류, 개체명 인식, 비디오 등
워크포스누가 레이블링할 것인가 (아래 표)
레이블링 UI내장 템플릿 또는 커스텀 HTML 템플릿

출력은 학습에 바로 쓸 수 있는 표준 augmented manifest(JSON Lines)로 나온다.

import boto3
sm = boto3.client("sagemaker")
 
sm.create_labeling_job(
    LabelingJobName="cat-dog-bbox",
    LabelAttributeName="annotations",
    InputConfig={"DataSource": {"S3DataSource": {
        "ManifestS3Uri": "s3://my-lake/labeling/input.manifest"}}},
    OutputConfig={"S3OutputPath": "s3://my-lake/labeling/output/"},
    RoleArn=role_arn,
    LabelCategoryConfigS3Uri="s3://my-lake/labeling/labels.json",
    HumanTaskConfig={
        "WorkteamArn": private_workteam_arn,        # 워크포스 선택 (아래 표)
        "PreHumanTaskLambdaArn": prehuman_lambda,
        "TaskTitle": "Draw boxes around cats and dogs",
        "NumberOfHumanWorkersPerDataObject": 3,     # 객체당 3명 → 합의
        "TaskTimeLimitInSeconds": 300,
    },
)

작업 유형별 레이블 형태

작업 유형에 따라 사람이 하는 일과 결과물의 모양이 다르다. 지문에서 "무엇을 붙여야 하는가"를 읽으면 유형이 정해진다.

작업 유형사람이 하는 일결과 레이블대표 용도
이미지 분류사진에 카테고리 하나 선택클래스 레이블불량/정상 판정
바운딩 박스객체마다 사각형 그리기좌표 + 클래스객체 검출
시맨틱 세그멘테이션픽셀 단위로 영역 칠하기픽셀 마스크의료 영상, 자율주행
텍스트 분류문서에 카테고리 부여클래스 레이블감성 분석, 문의 분류
개체명 인식(NER)문장에서 구간 지정오프셋 + 엔티티 타입문서 정보 추출
비디오 프레임/추적프레임별 객체 표시·추적시간축 + 좌표행동 인식
  • 위로 갈수록 작업당 시간이 짧고 아래로 갈수록 비싸다. 세그멘테이션은 분류보다 압도적으로 비싸다.
  • 비용을 줄이려면 "정말 세그멘테이션이 필요한가, 바운딩 박스로 충분한가"를 먼저 따져야 한다.

워크포스 선택표

데이터 민감도와 비용을 함께 보고 고른다.

워크포스특성적합한 경우금지되는 경우
Amazon Mechanical Turk대규모 공개 작업자, 저비용비민감 공개 데이터, 빠른 대량 처리PII·의료·금융 등 규제 데이터
Private사내 인력 또는 신뢰 그룹기밀·규제 데이터(의료, 금융)인력이 없어 대량 처리가 불가할 때
VendorAWS Marketplace 전문 업체전문 지식 필요(의료 영상 판독)예산이 극도로 제한적일 때

💡 개념: 환자 영상이나 PII 같은 민감 데이터를 Mechanical Turk 같은 공개 워크포스에 노출하면 컴플라이언스 위반이다. 이럴 땐 Private(사내) 또는 NDA·전문성을 갖춘 Vendor를 써야 한다. Specialty가 "민감 데이터의 레이블링 워크포스는?"이라 물으면 답은 거의 항상 Private 또는 Vendor다.

⚠️ 함정: 비용과 규모만 보고 Mechanical Turk를 고르는 것이 이 영역의 대표적 함정이다. 지문에 "환자", "PII", "규제", "기밀"이라는 단어가 하나라도 있으면 공개 워크포스 보기는 즉시 탈락시켜라.

액티브 러닝: 자동 레이블링으로 비용 줄이기

Ground Truth의 핵심 비용 절감 기능은 automated data labeling(액티브 러닝)이다. 동작 순서는 이렇다.

1. 사람이 일부(seed) 레이블링
        ▼
2. 그 레이블로 모델 학습
        ▼
3. 모델이 전체 데이터 예측
        ├─ 확신 높음 → 자동 레이블로 채택 (사람 개입 없음)
        └─ 확신 낮음 → 사람에게 라우팅
                          ▼
4. 사람이 모호한 것만 레이블링 → 2번으로 되돌아가 반복
  • 핵심 통찰: 모델이 모호해하는 결정 경계 근처 샘플에 사람 노동을 집중시키면, 전체의 일부만 레이블링하고도 높은 품질을 얻는다.
  • 데이터가 클수록, 레이블링 예산이 빠듯할수록 이득이 커진다.
# create_labeling_job에 LabelingJobAlgorithmsConfig를 추가하면 액티브 러닝이 켜진다
labeling_algorithm = {
    "LabelingJobAlgorithmsConfig": {
        # 작업 유형별 내장 알고리즘 ARN (이미지 분류 예시)
        "LabelingJobAlgorithmSpecificationArn":
            "arn:aws:sagemaker:us-east-1:027400017018:labeling-job-algorithm-specification/image-classification"
    }
}
# 확신 높은 객체는 모델이 자동 레이블링, 모호한 것만 사람에게 → 비용 ↓

💡 개념: 액티브 러닝은 "모든 데이터가 학습에 똑같이 유용하지는 않다"에서 출발한다. 모델이 이미 확신하는 샘플은 추가 레이블의 정보 가치가 낮고, 결정 경계 근처의 모호한 샘플(불확실성이 높은 샘플)이 정보 가치가 가장 크다. 그 모호한 샘플에만 집중하는 방식을 uncertainty sampling이라 한다.

레이블 품질 확보: 합의와 검증

사람은 실수한다. 부주의, 편향, 피로로 한 명의 레이블러는 틀릴 수 있다. Ground Truth는 여러 장치로 품질을 지킨다.

  • 합의(consensus): NumberOfHumanWorkersPerDataObject를 2~5로 설정해 같은 객체를 여러 명이 레이블링하고 결과를 통합한다(다수결·가중).
  • 주석 통합(annotation consolidation): 여러 답을 하나로 합치는 로직. 내장 기본값이 있고 필요하면 커스텀 Lambda로 교체한다.
  • 품질 검토 워크플로: 별도 워크포스가 결과를 검수·수정한다.
# 합의: 객체 1개를 3명이 레이블링 → 통합 알고리즘이 최종 레이블 산출
"NumberOfHumanWorkersPerDataObject": 3,
# 통합 로직 (기본은 다수결) 또는 커스텀 Lambda
"AnnotationConsolidationConfig": {
    "AnnotationConsolidationLambdaArn": consolidation_lambda_arn
}

레이블 품질을 재는 지표로 **레이블러 간 일치도(inter-annotator agreement, 예: Cohen's kappa)**가 있다. 일치도가 낮으면 지침이 모호하거나 작업 자체가 본질적으로 어렵다는 신호다.

오류 유형별 대응표

오류 유형예합의로 잡히나올바른 대응
무작위 실수피로로 한 명이 박스를 잘못 침잡힌다합의(다수결)
개인 편향특정 레이블러가 유독 관대함대체로 잡힌다합의 + 레이블러별 품질 추적
체계적 편향지침이 모호해 전원이 같은 방향으로 틀림못 잡는다지침 명확화 + golden set 검증
작업 난이도경계 사례가 본질적으로 애매함부분적지침에 경계 사례 예시 추가, 전문 Vendor

💡 개념: 레이블 노이즈는 모델 성능의 상한을 직접 깎는다. 합의 기반 레이블링은 다수결로 무작위 오류를 줄이지만 체계적 편향(모호한 지침 때문에 모든 레이블러가 같은 방향으로 틀리는 것)은 잡지 못한다. 명확한 레이블링 가이드라인과 golden set(정답을 이미 아는 표본)으로 검증하는 절차가 필수다. 정확도·레이블러 수·액티브 러닝 사이에는 비용 트레이드오프가 있고, 사람 레이블링의 양 자체를 줄이는 쪽이 비용과 품질을 함께 개선하는 정공법이다.

⚠️ 함정: "레이블러를 늘리면 품질이 좋아진다"만 외우면 체계적 편향 문제를 묻는 문제에서 틀린다. 보기에 "지침 명확화", "golden set"이 있으면 그쪽을 의심하라.

레이블링 대안: 정말 그 많은 데이터가 필요한가

레이블링을 시작하기 전에 세 가지를 먼저 묻자.

  1. 사전학습 모델 + 전이학습으로 적은 레이블만으로 될 일인가?
  2. 데이터 증강으로 기존 레이블을 더 멀리 쓸 수 있는가?
  3. 약한 감독(weak supervision) — 휴리스틱 규칙으로 대략적 레이블을 만들 수 있는가?

Specialty는 "레이블링 비용을 어떻게 줄이나?"를 자주 묻고, 액티브 러닝 + 전이학습이 단골 정답이다.

비용 절감 수단 비교

수단줄이는 것대가
액티브 러닝사람이 볼 샘플 수초기 seed 레이블은 여전히 필요
전이학습필요한 레이블 총량도메인이 너무 다르면 효과 감소
데이터 증강새 레이블 수집 필요량레이블이 깨지는 변형은 금물
약한 감독초기 레이블 확보 비용규칙이 만든 노이즈가 섞임
워크포스 단가 인하인건비민감 데이터에는 적용 불가

운영 중의 사람 검토: Amazon A2I

레이블링은 학습 전에만 필요한 게 아니다. 운영 중 모델이 확신하지 못하는 예측을 사람에게 넘겨 검토받는 흐름도 있다.

추론 요청 ─▶ 모델 예측 ─▶ 신뢰도 임계값 판단
                              ├─ 임계값 이상 → 그대로 응답
                              └─ 임계값 미만 → 사람 검토 대기열(A2I)
                                                    ▼
                                          검토 결과 저장 → 재학습 데이터로 축적
  • **Amazon Augmented AI(A2I)**는 이 "사람 검토 루프"를 구성하는 서비스다. 워크포스 개념은 Ground Truth와 공유한다.
  • 값어치는 두 겹이다. ① 저신뢰 예측의 품질을 사람이 보정하고, ② 그 검토 결과가 다음 재학습의 고품질 레이블이 된다.
  • 액티브 러닝과 발상이 같다. 모호한 것만 사람에게 보낸다는 원칙이 학습 단계(Ground Truth)와 운영 단계(A2I) 양쪽에 적용된다.

⚠️ 함정: "운영 중 저신뢰 예측을 사람이 검토"라는 지문에 Ground Truth를 고르면 어색하다. Ground Truth는 학습용 데이터셋에 레이블을 붙이는 도구이고, 추론 결과에 사람 검토를 끼워 넣는 것은 A2I의 자리다.

내일은 Week 1 전체(수명주기·저장·수집·레이블링)를 하나의 데이터 파이프라인으로 종합한다.

📖 용어

  • 레이블링 잡(labeling job) : 데이터에 정답을 붙이는 작업을 정의한 Ground Truth 실행 단위.
  • 매니페스트(manifest) : 레이블링할 대상 목록을 담은 JSON Lines 파일. 한 줄이 한 객체다.
  • augmented manifest : 원본 정보에 레이블 결과가 덧붙은 출력 파일. 학습 입력으로 바로 쓸 수 있다.
  • 워크포스(workforce) : 실제로 레이블링을 수행하는 인력 집단. Mechanical Turk·Private·Vendor 세 종류.
  • 액티브 러닝 : 모델이 확신하는 건 자동 처리하고 모호한 것만 사람에게 보내는 레이블링 전략.
  • uncertainty sampling : 모델이 가장 헷갈려 하는 샘플부터 골라 레이블링하는 방식.
  • 합의(consensus) : 같은 객체를 여러 명이 레이블링하고 다수결 등으로 하나의 답을 만드는 절차.
  • annotation consolidation : 여러 레이블러의 답을 하나로 합치는 통합 로직.
  • golden set : 정답을 이미 아는 검증용 표본. 레이블러와 지침의 품질을 점검하는 데 쓴다.
  • 체계적 편향 : 모두가 같은 방향으로 틀리는 오류. 다수결로는 걸러지지 않는다.

📝 연습 문제

선택지를 클릭하면 정답·해설이 펼쳐집니다.

문제 1

50만 장의 환자 X-ray를 레이블링해야 한다. 데이터는 PII를 포함한 의료 정보다. 워크포스 선택으로 가장 적절한 것은?

문제 2

100만 개 이미지에 대한 레이블링 예산이 빠듯하다. 사람의 라벨링 노동을 가장 정보 가치가 큰 샘플에 집중해 전체 비용을 줄이는 Ground Truth 기능은?

문제 3

라벨링 결과의 무작위 사람 오류를 줄이기 위해 동일 객체를 여러 명이 라벨링하고 종합하려 한다. Ground Truth에서 설정하는 항목은?

문제 4

합의(consensus) 기반 레이블링으로도 줄이기 어려운 레이블 품질 문제는?

문제 5

대량 이미지 분류 모델을 위한 레이블링 비용을 근본적으로 줄이는 접근으로 가장 부적절한 것은?

이전데이터 수집: Kinesis·Glue·배치 vs 스트리밍Week 1 · Day 3다음 Week 1 Integrated Review: ML Overview & Data Engineering 1Week 1 · Day 5

이 페이지

  • 핵심 정리
  • SageMaker Ground Truth: 레이블링 워크플로
  • 작업 유형별 레이블 형태
  • 워크포스 선택표
  • 액티브 러닝: 자동 레이블링으로 비용 줄이기
  • 레이블 품질 확보: 합의와 검증
  • 오류 유형별 대응표
  • 레이블링 대안: 정말 그 많은 데이터가 필요한가
  • 비용 절감 수단 비교
  • 운영 중의 사람 검토: Amazon A2I
  • 용어
  • 연습 문제