반응형
이전에 데이터 엔지니어링 강의를 들을 때도 나왔던 내용입니다.
- 관련 엔지니어링 강의 정리 https://lifeofsw.tistory.com/116
데이터 파이프라인이 조용히 실패하는 이유
- Data Quality : missing value, duplicates, inconsistent format
- 알람이 울리지 않지만 integrity of data에 영향, 부정확한 분석으로 이어짐
- Schema changes in upstream systems : 컬럼명 변경, data type 변경으로 인한 문제
- Pipeline이 결과를 낼 때까지 알 수 없음
- Data drift : data의 통계적 속성 변경
- Outdated 모델이나 부정확한 예측으로 이어질 수 있다
- 데이터가 현실의 패턴을 반영하지 못하기 때문에
- Model drift : 모델을 배포한 이후 시간이 지남에 따라 모델 성능이 저하되는 현상
- 유입되는 새 데이터가 매번 동일하다는 보장이 없음
- 데이터가 변할 가능성이 높다면 주기를 정하여 모델을 재학습해야
- 원인
- Data drift : 시간이 지남에 따라 input의 분포가 변함
- Label drift : 시간이 지남에 따라 target의 분포가 변함
- Concept drift : 시간이 지남에 따라 input-target의 관계가 변함
- Model Drift 관련 포스팅 https://lifeofsw.tistory.com/130
데이터 품질관리(1) - Model Drift, Data Silo
앞으로 데이터 품질관리와 관련된 용어를 정리해보려고 합니다. 오늘은 model drift와 data silo에 대해 정리해봤어요. Model Drift모델을 배포한 이후, 시간이 지남에 따라 모델 성능이 저하되는 현상
lifeofsw.tistory.com
- Data silo and inconsistent data sources : data는 개별 시스템이나 부서에 따라 silo될 수 있다
- 데이터 파이프라인 내에서 통합되었을 때 완전하지 않거나 일관성없는 데이터가 될 수 있음
- 치우쳐진 분석이나 비즈니스 인사이트에 영향을 줄 수 있다.
- Performance bottlenecks : 데이터 규모가 커지면 파이프라인 성능이 저하될 수 있다
데이터 파이프라인 실패 방지 방안
- Data Quality check
- Automated validation : 결측값, 중복값, 부정확한 형태의 data를 자동으로 확인할 수 있도록
- Real-time monitoring : 일관되지 않거나 이전에 이슈가 있었던 사항에 대해 자동 알람 설정
- Automated Schema validation
- Schema monitoring : 컬럼명 변경, 데이터 타입 변경 등 스키마 변경을 자동적으로 파악할 수 있는 툴 구축
- Schema evolution : 모든 스키마 변경사항을 문서화하고 파이프라인에 통합
- Monitoring data drift
- Continous monitoring tools : 유입되는 데이터의 통계 분포를 트래킹할 수 있는 툴 구축
- Model adjustments : 정기적으로 모델을 재학습시키거나, 알고리즘을 수정
- Data integration and visivility
- Centralized data platform : 다양한 데이터 소스의 데이터를 통일된 형태로 통합, data silo 의 영향을 줄임
- Data lineage : transformation과 dependency를 포함한 데이터 흐름을 시각화, data를 트래킹하고 비일관성이나 오염을 규명할 수 있도록
- Performance monitoring and scalability
- Real time performance tracking : CPU, 메모리, 네트워크 사용량 등의 성능 모니터링 툴 구축. 파이프라인 최적화
- Auto scaling : 데이터 양에 따라서 리소스를 할당하는 자동 스케일링 도입
결국 자동화를 통해서 사람의 손을 직접 거쳐야하는 과정을 줄이고, 오류를 줄인다는 게 핵심같네요.
Reference
5 Reasons Why Your Data Pipeline is Silently Failing
Bad Data is the most prominent reason why Data Pipelines fail.
medium.com
'POV : Point of View > Analyst' 카테고리의 다른 글
| 데이터 문화(2) - 데이터 거버넌스 (0) | 2026.01.22 |
|---|---|
| Defy Default Meetup 행사 : CTRL+SHIFT 참여 후기 (0) | 2025.09.25 |
| 당근/토스/쿠팡 사용일지 작성 후기(작성 이유, 남은 것) (0) | 2025.09.21 |
| 데이터 문화(1) - 데이터 민주화 (0) | 2025.04.07 |
| 데이터 품질관리(1) - Model Drift, Data Silo (0) | 2025.03.21 |