[SAA-C03] 데이터 분석 레이어
[SAA-C03] 데이터 분석 레이어 — #개발자의도구들 #AWSSAA #AWSS3 #AWSRedshift #AWSGlue #AWSKinesis #AWSLake ...
#개발자의도구들 #AWSSAA #AWSS3 #AWSRedshift #AWSGlue #AWSKinesis #AWSLake
\* AWS SAA 도전기 목록: https://blog.naver.com/jword\_/224028873217
🎯목표
애플리케이션에서 발생하는 모든 데이터는 잠재적인 가치를지닌다.
AWS에서 데이터의 잠재적 가치를 발견하기 위해 데이터 분석을 수행할 수 있다.
데이터 분석에는 다음과 같은 단계를 가진다.
- 데이터 저장
- 데이터 수집 및 이동
- 데이터 분석 / 쿼리
- 머신러닝 / 고급 분석
- 데이터 거버넌스 관리
각 단계별로 어떤 서비스가 사용되는지 알아보자
데이터 저장
storage Layer
📌S3
비정형 데이터 저장소
- CSV
- Json
- Log
- image
👉Data Lake의 중심 저장소이다.
“Data Lake”, “store raw data”, “durable and scalable storage”
📌RDS / DynamoDB
정형 데이터 저장소
👉트랜잭션 데이터(OLTP)
“application data”, “OLTP”, “row-based storage”
*OLTP: Online Transaction Processing
📌RedShift
대규모 분석을 위한 컬럼 기반 데이터 웨어하우스
- OLAP(Online Analytical Processing)
👉대량의 정형 데이터를 빠르게 분석
“Data warehouse”, “complex queries”, “BI tools”, “columnar storage”
데이터 수집 \* 이동
Ingestion & ETL Layer
*ETL Layer: 데이터 엔지니어링에서 다양한 소스의 데이터를 수집하고,
분석에 적합한 형태로 가공하여 단일 저장소(데이터 웨어하우스, 데이터 레이크 등)에
저장하는 일련의 데이터 통합 프로세스 및 아키텍처 계층
📌AWS Glue
ETL서비스, 크롤러로 메타데이터 자동생성
👉S3 → RedShift/ Athena로 데이터 이동 시
“ETL”, “data catalog”, “schema discovery”, “serverless data integration”
📌Kinesis Data Filrehose / Streams
실시간 스트리밍 데이터 수집
👉로그, IoT, 실시간 이벤트 수집
“real-time streaming data”
📌AWS DMS(Data Migration Service)
DB 간 데이터 복제 및 마이그레이션
👉온프레미스 → AWS DB 이전
“migrate database to AWS”
데이터 분석 / 쿼리
Analytics Layer
📌Amazon Athena
S3에 저장된 데이터를 SQL로 직접 질의
- 서버리스
- Presto 기반
👉S3 데이터 쿼리 관련
“query data in S3”, “serverless SQL”, “no ETL needed”
📌Amazon Redshift Spectrum
Redshift가 S3데이터를 외부 테이블로 쿼리
👉Redshift + S3 혼합 분석
“query S3 data from Redshift”
📌Amazon EMR
Hadoop. Spark 등 빅데이터 프레임워크 실행
👉대규모 데이터 처리(비정형 + 복잡한 반환)
“Hadoop/Spark”, “big data processing”, “custom framework”
머신러닝 / 고급 분석
AL/ML Layer
📌SageMaker
머신러닝 모델 학습 및 배포
👉데이터 기반 예측/분류 문제
“train ML models”, “Jupyter notebook”, “deploy endpoints”
데이터 거버넌스 / 관리
Governance & Catalog
📌AWS Glue Data Catalog
데이터셋의 메타데이터 중앙 저장소
👉여러 서비스가 동일한 데이터 스키마 참조시
“central metadata store”, “schema registry”
📌AWS Lake Formation
S3기반 데이터레이크 권한 관련, 접근 제어
👉Data Lake 보안 관리 자동화
“data lake governance”, “fine-grained permissions”
시험 tip
| 목표 | 사용 서비스 | 핵심 포인트 |
|---|---|---|
| 원본 로그/데이터 저장 | S3 | 확장성, 내구성, Data Lake 중심 |
| 정형 데이터 분석용 웨어하우스 | Redshift | OLAP, BI, 대규모 SQL 분석 |
| 데이터 변환 및 이동 | Glue | 서버리스 ETL, Data Catalog |
| 즉석 쿼리 (ETL 없이) | Athena | S3 데이터에 SQL 실행 |
| 대용량 분산처리 | EMR | Hadoop/Spark 기반, 커스텀 분석 |
| 실시간 데이터 스트림 | Kinesis | 실시간 수집, 분석 |
| 머신러닝 | SageMaker | 모델 학습, 배포 |
| 데이터 거버넌스 | Lake Formation | 권한 제어, 중앙 관리 |
| 문제 상황 | 정답 서비스 | 이유 |
|---|---|---|
| “S3에 저장된 데이터를 SQL로 분석하고 싶다. 서버 관리 없이.” | Athena | S3 직접 쿼리, 서버리스 |
| “S3에 저장된 데이터를 정제 후 Redshift로 적재하고 싶다.” | Glue | ETL + 크롤러 + Data Catalog |
| “매일 수 TB의 데이터를 분석해야 한다. 고성능 SQL 분석 필요.” | Redshift | 데이터 웨어하우스, 컬럼 기반, 병렬 처리 |
| “Spark를 사용해 커스텀 데이터 파이프라인을 만들고 싶다.” | EMR | 커스텀 프레임워크 실행 가능 |
| “데이터 레이크에 접근 제어를 중앙에서 관리하고 싶다.” | Lake Formation | Fine-grained permission 제어 |
| “Redshift에서 S3 데이터를 직접 쿼리하고 싶다.” | Redshift Spectrum | Redshift 외부 테이블 기능 |
| “온프레미스 DB를 AWS로 실시간 복제하고 싶다.” | DMS | 데이터 마이그레이션 전용 서비스 |