Cert Notes/ 출퇴근 학습 노트
로드맵
KOEN
CLF-C02 · FoundationalCloud Practitioner - Foundational
DVA-C02 · AssociateDeveloper - Associate
SAA-C03 · AssociateSolutions Architect - Associate
SOA-C02 · AssociateCloudOps Engineer - Associate
SAP-C02 · ProfessionalSolutions Architect - Professional
DOP-C02 · ProfessionalDevOps Engineer - Professional
SCS-C03 · SpecialtySecurity - Specialty
MLA-C01 · AssociateMachine Learning Engineer - Associate
  • Week 1
    • 1.ML 수명주기와 ML 엔지니어의 역할
    • 2.ML 문제 유형과 평가 지표 기초
    • 3.AWS ML 스택 한눈에 보기
    • 4.SageMaker 개요: Studio, 학습/추론, 빌트인 알고리즘
    • 5.Week 1 종합 — ML 기초·AWS 스택 복습
  • Week 2
    • 1.데이터 수집: S3 데이터 레이크, Kinesis, 배치 수집, 데이터 포맷
    • 2.데이터 카탈로그·ETL: AWS Glue와 DataBrew
    • 3.쿼리·탐색: Athena, Redshift, EDA 기초
    • 4.데이터 저장 전략: 파티셔닝·포맷 최적화·학습용 준비
    • 5.Week 2 종합 — 데이터 수집·저장 복습
  • Week 3
    • 1.특성 공학: 모델이 읽을 수 있는 숫자로 바꾸는 기술
    • 2.SageMaker Data Wrangler: 코드 없이 끝내는 데이터 준비
    • 3.SageMaker Feature Store: 특성을 자산으로 관리하기
    • 4.데이터 편향·품질: Clarify, 불균형 처리, 데이터 분할
    • 5.Week 3 종합 — 특성 공학·데이터 품질 복습
  • Week 4
    • 1.SageMaker 학습 작업(Training Job): Estimator, 입력 채널, 인스턴스, Spot
    • 2.빌트인 알고리즘: XGBoost, Linear Learner, 이미지·텍스트, 입력 포맷
    • 3.하이퍼파라미터 튜닝(AMT): 베이지안·랜덤·그리드, 조기 종료, 워밍 스타트
    • 4.JumpStart·사전학습 모델·전이학습 + 학습 비용 최적화
    • 5.Week 4 종합: 모델 개발 1 — SageMaker 학습 복습
  • Week 5
    • 1.커스텀 학습: 스크립트 모드, BYOC, 프레임워크 컨테이너
    • 2.분산 학습: 데이터 병렬과 모델 병렬
    • 3.디버깅과 프로파일링: SageMaker Debugger와 Profiler
    • 4.모델 평가: 지표 선택, 과적합, 교차검증, 혼동행렬
    • 5.Week 5 종합: 모델 개발 2 복습
  • Week 6
    • 1.추론 옵션 개요: 4가지 배포 방식과 선택 기준
    • 2.실시간 엔드포인트: 구성, 오토스케일링, 인스턴스 선택
    • 3.비용·고급 추론: 멀티모델, 멀티컨테이너, 추론 파이프라인, Inferentia
    • 4.배치·서버리스 추론 심화: 대량 처리 튜닝과 비용 트레이드오프
    • 5.Week 6 종합: 추론 배포 복습
  • Week 7
    • 1.SageMaker Pipelines: 단계, DAG, 파라미터, 조건 단계
    • 2.Model Registry & 모델 거버넌스: 모델 패키지 그룹, 승인 워크플로, 버전 관리
    • 3.CI/CD for ML: SageMaker Projects, CodePipeline/CodeBuild 연계, 자동 배포
    • 4.IaC & 워크플로 오케스트레이션: CloudFormation/CDK, Step Functions, EventBridge, Airflow(MWAA)
    • 5.Week 7 종합: MLOps 복습
  • Week 8
    • 1.SageMaker Model Monitor: 데이터 품질·모델 품질 드리프트
    • 2.편향·설명가능성 드리프트: Clarify로 운영 중 감시
    • 3.운영 모니터링: CloudWatch 지표·알람, 엔드포인트 지연·오류, 로깅
    • 4.재학습·모델 유지보수: 자동 재학습 파이프라인과 A/B·섀도 테스트
    • 5.Week 8 종합: ML 솔루션 모니터링·유지보수 복습
  • Week 9
    • 1.SageMaker IAM 보안: 실행 역할과 최소 권한
    • 2.네트워크 격리: VPC 모드 SageMaker와 PrivateLink
    • 3.데이터·모델 보호: KMS 암호화와 Secrets
    • 4.ML 비용 최적화: Spot 학습부터 비용 모니터링까지
    • 5.Week 9 종합: 보안·거버넌스·비용 복습
  • Week 10
    • 1.도메인 1·2 통합 복습: 데이터 준비 + 모델 개발
    • 2.도메인 3·4 통합 복습: 배포·오케스트레이션 + 모니터링·보안
    • 3.전체 모의고사 페이스: 4개 도메인 종합 시나리오
    • 4.자주 틀리는 함정·키워드: "요구사항 → SageMaker 기능" 번역표
    • 5.D-Day 마무리: 시험 구성·시간 배분·시나리오 분해 전략
AIF-C01 · FoundationalAI Practitioner - Foundational
DEA-C01 · AssociateData Engineer - Associate
MLS-C01 · SpecialtyMachine Learning - Specialty
합격 후기
← MLA-C01/Week 1/Day 3
MLA-C01· AssociateWeek 1 · Day 3읽기 약 14분

Day 3 - AWS ML 스택 한눈에 보기

📌 핵심 정리

  • AWS ML 스택은 **AI 서비스(API 호출) → SageMaker(직접 학습) → 인프라(직접 컴퓨팅)**의 3층이다.
  • 층 선택은 추상화 레벨과 통제권의 트레이드오프 — 위는 빠르고 쉽지만 통제권이 적고, 아래는 자유롭지만 부담이 크다.
  • 표준 작업(이미지·음성·번역·OCR·감정)은 AI 서비스, 커스텀 모델은 SageMaker, 극한 비용·성능은 인프라.
  • 인프라 층에서 Trainium은 학습용, Inferentia는 추론용으로 칩이 분리돼 있다.
  • Comprehend Custom·Rekognition Custom Labels처럼 AI 서비스와 SageMaker 사이의 중간 선택지도 있다.

AWS ML 스택의 3층 구조

AWS의 ML 관련 서비스는 수십 개라 처음 보면 막막하다. 하지만 "직접 모델을 만들 거냐, 완성된 모델을 API로 호출할 거냐, 아니면 바닥 인프라부터 다룰 거냐"라는 질문 하나로 세 개의 층에 깔끔하게 정리된다.

┌─────────────────────────────────────────────────┐  추상화 ↑
│ 상위: AI 서비스 (사전 학습 모델, API 호출만)        │  통제권 ↓
│   Rekognition, Comprehend, Transcribe,           │  ML 전문성 ↓
│   Translate, Polly, Textract, Forecast, Bedrock  │  구현 속도 ↑
├─────────────────────────────────────────────────┤
│ 중위: ML 플랫폼 (직접 학습·배포)                    │
│   Amazon SageMaker (AI)                          │
├─────────────────────────────────────────────────┤
│ 하위: ML 인프라 (직접 컴퓨팅 관리)                  │  추상화 ↓
│   EC2(GPU), Inferentia, Trainium, EKS, ECS, FSx  │  통제권 ↑
└─────────────────────────────────────────────────┘  운영 부담 ↑

세 층을 한 표로 비교하면 판별이 빨라진다.

기준AI 서비스SageMakerML 인프라
모델을 누가 만드나AWS(사전 학습)고객(직접 학습)고객(전부)
필요한 ML 전문성거의 없음중~상상
구현 속도가장 빠름중간느림
커스터마이징제한적자유로움완전 자유
운영 부담없음관리형(중간)전부 고객
전형적 판단 문구"표준 작업""고유 데이터로 커스텀""극한 비용·성능", "기존 EKS 통합"

판별 원칙은 추상화 레벨과 통제권의 트레이드오프다. ML 엔지니어는 "ML 전문성이 없어도 되는 표준 작업이면 위, 커스텀 모델이 필요하면 중간, 극한의 성능·비용 최적화가 필요하면 아래"로 고른다.

💡 관련 이론: 이건 공동 책임 모델의 ML 버전이다. AI 서비스는 모델 학습·인프라까지 AWS가 책임지고 고객은 API 호출과 데이터만, SageMaker는 모델 코드·데이터는 고객이지만 인프라 관리는 AWS가, EC2 자체 구축은 거의 모든 것을 고객이 책임진다. 추상화가 올라갈수록 책임 경계선이 위로 올라간다는 원칙이 그대로 적용된다.

상위: AI 서비스 — 모델 없이 ML 기능 쓰기

AI 서비스는 AWS가 미리 학습해둔 모델을 API 호출 한 번으로 쓰는 것이다. ML 지식이 거의 없어도 된다. 시험에 잘 나오는 매핑을 외워두면 시나리오 문제가 쉬워진다.

서비스입력 → 출력용도시나리오 키워드
Rekognition이미지/영상 → 객체·얼굴·텍스트이미지 분석, 콘텐츠 검열"사진에서 무엇이 보이나"
Comprehend텍스트 → 감정·개체·키워드NLP, 감정 분석"리뷰 감정", "개체 추출"
Transcribe음성 → 텍스트음성 인식(STT)"녹음 파일을 텍스트로"
Polly텍스트 → 음성음성 합성(TTS)"텍스트를 읽어주는"
Translate텍스트 → 번역 텍스트기계 번역"다국어 지원"
Textract문서 이미지 → 구조화 텍스트OCR, 양식·표 추출"스캔한 청구서·양식"
Forecast시계열 → 미래 예측수요 예측"다음 분기 수요"
Personalize사용자 행동 → 추천추천 시스템"개인화 추천"
Bedrock프롬프트 → 생성 결과생성형 AI(LLM)"요약 생성", "챗봇"
import boto3
 
# Comprehend로 감정 분석 — 모델 학습 0줄
comprehend = boto3.client("comprehend", region_name="ap-northeast-2")
resp = comprehend.detect_sentiment(
    Text="이 제품 정말 만족스럽고 배송도 빨랐어요!",
    LanguageCode="ko",
)
print(resp["Sentiment"])         # POSITIVE
print(resp["SentimentScore"])    # {'Positive': 0.98, ...}

위 코드에 학습 데이터도 모델도 없다. AWS의 사전 학습 모델을 호출만 한다. "고객 리뷰 감정을 분석하라"는 시나리오에 SageMaker로 모델을 만들겠다고 답하면 과한 선택이다 — Comprehend가 정답이다.

중간 선택지도 있다. AI 서비스와 SageMaker 사이에는 "사전 학습 모델을 내 라벨로 살짝 조정"하는 옵션이 있다.

선택지무엇을 하나언제 고르나
AI 서비스 기본 API사전 학습 모델 그대로표준 작업, 도메인 특수성 없음
Comprehend Custom Classification/Entity자체 라벨로 분류·개체 추출 미세조정회사 고유 분류 체계가 필요
Rekognition Custom Labels특정 도메인 객체를 학습우리 제품 결함처럼 일반 모델이 모르는 객체
SageMaker 풀 커스텀알고리즘·데이터·컨테이너 전부 통제위로 안 되거나 성능·구조를 직접 설계

🔍 더 깊이: "표준 감정 분석이면 기본 Comprehend, 우리 회사 고유 분류 체계가 필요하면 Custom"으로 판별한다. Custom 옵션은 SageMaker 풀 커스텀보다 훨씬 적은 노력으로 끝나므로, 시험에서 "최소한의 ML 전문성으로 도메인 특화"라는 조건이 붙으면 Custom 계열이 정답 후보다.

중위: SageMaker — 직접 모델을 만드는 곳

표준 AI 서비스로 안 되는 커스텀 모델이 필요하면 Amazon SageMaker다. 데이터 준비부터 학습·튜닝·배포·모니터링까지 ML 수명주기 전체를 담당하는 통합 플랫폼이며, MLA-C01의 사실상 주인공이다.

SageMaker가 제공하는 것을 수명주기 단계별로 보면:

단계대표 기능하는 일
데이터Data Wrangler, Feature Store, Ground Truth전처리, 피처 저장, 라벨링
학습빌트인 알고리즘, 커스텀 컨테이너, 분산 학습모델 학습
튜닝Automatic Model Tuning하이퍼파라미터 최적화
배포실시간/서버리스/배치/비동기, 멀티모델 엔드포인트추론 서빙
운영Model Monitor, Model Registry, Pipelines드리프트 감지, 버전 관리, MLOps
# SageMaker는 "직접 학습"한다 — AI 서비스와 결정적 차이
from sagemaker.estimator import Estimator
 
estimator = Estimator(
    image_uri=sagemaker.image_uris.retrieve("xgboost", region, "1.7-1"),
    role=role, instance_count=1, instance_type="ml.m5.xlarge",
    hyperparameters={"objective": "binary:logistic", "num_round": 100},
)
estimator.fit({"train": "s3://my-bucket/train/", "validation": "s3://my-bucket/val/"})
predictor = estimator.deploy(initial_instance_count=1, instance_type="ml.t2.medium")

AI 서비스 코드와 비교해보면 차이가 분명하다. Comprehend는 detect_sentiment() 한 줄이지만, SageMaker는 학습 데이터·알고리즘·인스턴스·하이퍼파라미터를 전부 지정한다. 그 대가로 무엇이든 만들 수 있다.

내일(Day 4) SageMaker를 본격적으로 다룬다. 오늘은 "SageMaker는 커스텀 모델을 직접 학습·배포하는 중간 층"이라는 위치만 잡으면 된다.

하위: ML 인프라 — 성능과 비용을 직접 깎기

SageMaker가 추상화하는 그 아래에는 실제 컴퓨팅이 있다. 극한의 성능·비용 최적화가 필요하거나 기존 EKS/ECS 위에 ML을 얹어야 할 때 이 층을 직접 다룬다.

칩/리소스용도특징
EC2 GPU (P5/P4, G5)학습·추론 범용NVIDIA GPU, 가장 유연
AWS Trainium (Trn1)대규모 모델 학습AWS 자체 칩, 학습 비용↓
AWS Inferentia (Inf2)대규모 추론AWS 자체 칩, 추론 비용·전력↓
Elastic Inference추론 가속 부분 부착GPU 일부만 빌려 비용 절감
FSx for Lustre고속 학습 데이터S3 연동 고성능 파일시스템

핵심 구분은 Trainium은 학습용, Inferentia는 추론용이라는 점이다. 두 작업은 연산 성격 자체가 다르다.

구분학습(Training)추론(Inference)
연산순전파 + 역전파(그래디언트 계산)순전파만
배치큰 배치를 한 번에작은 배치를 자주
최적화 목표처리량(throughput)지연(latency)
실행 빈도주기적(주 1회 등)요청마다 무한 반복
AWS 전용 칩TrainiumInferentia

추론은 학습보다 훨씬 자주 일어나므로 추론 비용 절감이 총비용에 더 크게 기여한다. 그래서 AWS가 추론 전용 칩 Inferentia를 따로 만든 것이다.

📚 사례: 대규모 추론 트래픽을 가진 서비스는 추론 비용이 학습 비용을 압도하는 경우가 많다. 모델은 한 번 학습하지만 추론은 사용자 요청마다 무한히 반복되기 때문이다. AWS가 GPU 외에 Inferentia라는 추론 전용 칩을 별도로 설계한 배경이 이것이고, 같은 모델을 GPU 대비 더 낮은 단가·전력으로 서빙해 총소유비용을 낮추는 것이 목표다. ML 엔지니어가 "학습 칩과 추론 칩을 분리해서 고른다"는 감각을 가져야 하는 이유다.

💡 관련 이론: 학습은 순전파+역전파로 그래디언트를 계산하고 큰 배치를 한 번에 처리(throughput 중심)하지만, 추론은 순전파만 하고 낮은 지연으로 작은 배치를 자주 처리(latency 중심)한다. 이 차이 때문에 Trainium(고처리량 학습)과 Inferentia(저지연 추론)를 칩 레벨에서 분리하는 것이 합리적이다.

시나리오로 층 고르기

시험 문제는 거의 항상 시나리오다. 판별 흐름을 정리하면:

시나리오를 읽는다
   │
   ├─ 이미지/음성/번역/OCR/감정 같은 표준 작업인가?
   │     예 → AI 서비스 (Rekognition, Comprehend, Textract ...)
   │           └─ 우리 회사 고유 분류/객체가 필요한가?
   │                 예 → Comprehend Custom / Rekognition Custom Labels
   │
   ├─ 고유 데이터로 커스텀 모델을 만들어야 하는가?
   │     예 → SageMaker (학습 → 튜닝 → 배포)
   │
   └─ 극한 비용·성능 최적화 또는 기존 컨테이너 통합인가?
         예 → EC2 GPU / Trainium(학습) / Inferentia(추론) / EKS·ECS

빠른 매핑 연습:

시나리오정답 방향
스캔한 청구서에서 항목을 추출Textract
우리 고유 제품 결함 이미지를 분류Rekognition Custom Labels 또는 SageMaker
수백만 건 추론을 최소 비용으로Inferentia
대규모 모델을 저비용으로 학습Trainium
콜센터 녹음을 텍스트로 바꿔 감정 분석Transcribe + Comprehend 조합
사내 문서로 챗봇 답변 생성Bedrock

⚠️ 함정: "표준 작업인데 SageMaker로 직접 학습"은 시험에서 거의 항상 오답이다. 기술적으로 가능하더라도 시간·비용·운영 부담이 과하기 때문이다. 반대로 "도메인 특화 데이터인데 기본 AI 서비스"도 오답이다. 지문에서 작업의 일반성 vs 고유성을 가르는 단서를 먼저 찾아라.

지문에서 층을 가르는 단서

시나리오 문제는 결국 몇 개의 단어로 층이 갈린다. 단서를 미리 표로 익혀두면 읽는 속도가 붙는다.

지문 단서가리키는 층이유
"ML 전문 인력이 없다"AI 서비스학습 없이 API만
"가능한 한 빨리 출시"AI 서비스구현 시간이 가장 짧음
"표준적인 이미지/음성/번역 작업"AI 서비스사전 학습 모델로 충분
"우리 회사 고유 분류 체계"Custom 계열 또는 SageMaker도메인 라벨이 필요
"자체 데이터로 모델을 학습"SageMaker커스텀 학습이 핵심
"알고리즘을 직접 구현"SageMaker 스크립트 모드/커스텀 컨테이너코드 통제가 필요
"추론 비용을 최소화"Inferentia추론 전용 칩
"대규모 학습 비용을 절감"Trainium, 스팟 인스턴스학습 측 최적화
"이미 EKS/ECS를 운영 중"ML 인프라 층기존 컨테이너 플랫폼에 통합
"운영 부담을 최소화"상위 층관리형일수록 부담이 작음

층을 잘못 고르면 생기는 손실

잘못된 선택대가
표준 감정 분석을 SageMaker로 직접 학습라벨링·학습·운영 비용이 몇 배, 정확도도 사전 학습 모델보다 낮기 쉬움
도메인 특화 결함 탐지를 기본 Rekognition으로우리 제품의 결함 유형을 모델이 모름
소규모 추론을 위해 EC2 GPU 직접 구축유휴 비용과 운영 인력이 낭비
대량 추론을 GPU만으로 서빙Inferentia 대비 단가·전력에서 불리

⚠️ 함정: "가장 정확한 방법"과 "가장 적절한 방법"은 다르다. 시험은 거의 항상 요구사항을 만족하는 가장 적은 노력·비용의 선택을 정답으로 본다. 기술적으로 가능한 답이 여러 개일 때는 운영 부담을 기준으로 걸러라.

다음 글에서는 이 스택의 중심인 SageMaker를 본격적으로 파고들어, Studio·학습·추론·빌트인 알고리즘·도메인과 사용자 프로필 구조를 본다.

📖 용어

  • AI 서비스 : AWS가 미리 학습해둔 모델을 API 호출만으로 쓰는 상위 계층 서비스. 학습이 필요 없다.
  • 사전 학습 모델(pre-trained model) : 이미 대량 데이터로 학습을 마쳐 바로 쓸 수 있는 모델.
  • 추상화 레벨 : 세부 사항을 얼마나 감춰주는가의 정도. 높을수록 편하지만 손댈 수 있는 게 줄어든다.
  • 커스터마이징 : 내 데이터·요구에 맞게 모델을 고치는 것. AI 서비스는 제한적, SageMaker는 자유롭다.
  • Comprehend Custom : 회사 고유 라벨로 Comprehend를 미세조정해 자체 분류·개체 추출을 만드는 기능.
  • Rekognition Custom Labels : 일반 모델이 모르는 특정 도메인 객체를 이미지로 학습시키는 기능.
  • Trainium(Trn1) : AWS가 만든 학습 전용 칩. 대규모 모델 학습 비용을 낮추는 것이 목표다.
  • Inferentia(Inf2) : AWS가 만든 추론 전용 칩. 요청마다 반복되는 추론의 단가·전력을 낮춘다.
  • 순전파 / 역전파 : 입력을 흘려 예측을 내는 계산 / 오차를 거슬러 보내 가중치를 고치는 계산.
  • 처리량(throughput) vs 지연(latency) : 단위 시간에 얼마나 많이 처리하나 / 한 건이 얼마나 빨리 끝나나.

📝 연습 문제

선택지를 클릭하면 정답·해설이 펼쳐집니다.

문제 1

"고객이 남긴 영어 리뷰 텍스트의 긍정/부정 감정을 분석하라"는 표준 요구사항에 가장 적절한 AWS 서비스는?

문제 2

AWS ML 스택 3층 구조에서 위로 올라갈수록(AI 서비스 방향) 나타나는 특징으로 옳은 것은?

문제 3

대규모 추론 트래픽의 비용을 최소화해야 하는 ML 엔지니어가 고려할 AWS 전용 칩은?

문제 4

SageMaker가 AI 서비스(Rekognition, Comprehend 등)와 구별되는 결정적 차이는?

문제 5

학습용 칩과 추론용 칩을 별도로 설계하는 것이 합리적인 이유로 옳은 것은?

이전ML 문제 유형과 평가 지표 기초Week 1 · Day 2다음 SageMaker 개요: Studio, 학습/추론, 빌트인 알고리즘Week 1 · Day 4

이 페이지

  • 핵심 정리
  • AWS ML 스택의 3층 구조
  • 상위: AI 서비스 — 모델 없이 ML 기능 쓰기
  • 중위: SageMaker — 직접 모델을 만드는 곳
  • 하위: ML 인프라 — 성능과 비용을 직접 깎기
  • 시나리오로 층 고르기
  • 지문에서 층을 가르는 단서
  • 층을 잘못 고르면 생기는 손실
  • 용어
  • 연습 문제