- 기간 : 2023.06 ~ 2023.06
- 인력: 1명
👩🏫소개
Databricks - Spark 기반으로 Classification 모델 구축 및 배포
- Kaggle에 있는 고객 이탈 데이터 사용하여 분류 모델 구축
- 신규 데이터 들어왔을 때 자동 데이터 처리 및 Table Refresh Pipeline구축
- 훈련된 모델 배포 및 Serving
- SERVING된 모델을 사용하여 데이터 예측 및 결과 확인
작업 내용
아키텍처

데이터 준비
kaggle_churn_classification_mlflow_pipeline/(final)00_data_prepare.py at main · cocoheart0128/kaggle_churn_classification_mlflow_pipeline
- Kaggle API 연결하여 데이터 다운로드
- spark로 데이터 읽고 데이터 베이스 만들고 table 로 저장
데이터 전처리
kaggle_churn_classification_mlflow_pipeline/(final)01_data_preprocessing_feature_store.py at main · cocoheart0128/kaggle_churn_classification_mlflow_pipeline
- spark 전처리 pipeline (string_indexer+vector_assembler)