POV : Point of View/Analyst

데이터 품질관리(2) - 데이터 파이프라인

sennysideup 2025. 5. 10. 14:11
반응형

이전에 데이터 엔지니어링 강의를 들을 때도 나왔던 내용입니다.

 

데이터 파이프라인이 조용히 실패하는 이유

  • Data Quality : missing value, duplicates, inconsistent format
    • 알람이 울리지 않지만 integrity of data에 영향, 부정확한 분석으로 이어짐
  • Schema changes in upstream systems : 컬럼명 변경, data type 변경으로 인한 문제
    • Pipeline이 결과를 낼 때까지 알 수 없음
  • Data drift : data의 통계적 속성 변경
    • Outdated 모델이나 부정확한 예측으로 이어질 수 있다
    • 데이터가 현실의 패턴을 반영하지 못하기 때문에
    • Model drift : 모델을 배포한 이후 시간이 지남에 따라 모델 성능이 저하되는 현상
      • 유입되는 새 데이터가 매번 동일하다는 보장이 없음
      • 데이터가 변할 가능성이 높다면 주기를 정하여 모델을 재학습해야
      • 원인
        • Data drift : 시간이 지남에 따라 input의 분포가 변함
        • Label drift : 시간이 지남에 따라 target의 분포가 변함
        • Concept drift : 시간이 지남에 따라 input-target의 관계가 변함
      • Model Drift 관련 포스팅 https://lifeofsw.tistory.com/130

 

데이터 품질관리(1) - Model Drift, Data Silo

앞으로 데이터 품질관리와 관련된 용어를 정리해보려고 합니다. 오늘은 model drift와 data silo에 대해 정리해봤어요. Model Drift모델을 배포한 이후, 시간이 지남에 따라 모델 성능이 저하되는 현상

lifeofsw.tistory.com

  • Data silo and inconsistent data sources : data는 개별 시스템이나 부서에 따라 silo될 수 있다
    • 데이터 파이프라인 내에서 통합되었을 때 완전하지 않거나 일관성없는 데이터가 될 수 있음
    • 치우쳐진 분석이나 비즈니스 인사이트에 영향을 줄 수 있다.
  • Performance bottlenecks : 데이터 규모가 커지면 파이프라인 성능이 저하될 수 있다

 

데이터 파이프라인 실패 방지 방안

  • Data Quality check
    • Automated validation : 결측값, 중복값, 부정확한 형태의 data를 자동으로 확인할 수 있도록
    • Real-time monitoring : 일관되지 않거나 이전에 이슈가 있었던 사항에 대해 자동 알람 설정
  • Automated Schema validation
    • Schema monitoring : 컬럼명 변경, 데이터 타입 변경 등 스키마 변경을 자동적으로 파악할 수 있는 툴 구축
    • Schema evolution : 모든 스키마 변경사항을 문서화하고 파이프라인에 통합
  • Monitoring data drift
    • Continous monitoring tools : 유입되는 데이터의 통계 분포를 트래킹할 수 있는 툴 구축
    • Model adjustments : 정기적으로 모델을 재학습시키거나, 알고리즘을 수정
  • Data integration and visivility
    • Centralized data platform : 다양한 데이터 소스의 데이터를 통일된 형태로 통합, data silo 의 영향을 줄임
    • Data lineage : transformation과 dependency를 포함한 데이터 흐름을 시각화, data를 트래킹하고 비일관성이나 오염을 규명할 수 있도록
  • Performance monitoring and scalability
    • Real time performance tracking : CPU, 메모리, 네트워크 사용량 등의 성능 모니터링 툴 구축. 파이프라인 최적화
    • Auto scaling : 데이터 양에 따라서 리소스를 할당하는 자동 스케일링 도입

 

결국 자동화를 통해서 사람의 손을 직접 거쳐야하는 과정을 줄이고, 오류를 줄인다는 게 핵심같네요.

Reference

 

5 Reasons Why Your Data Pipeline is Silently Failing

Bad Data is the most prominent reason why Data Pipelines fail.

medium.com