분산 학습과 MLOps
멀티 GPU 분산 학습 방식과 실험 관리, 모델 배포, 모니터링, 재학습 파이프라인을 정리한다.
Single GPU와 Multi-GPU Data Parallelism Distributed Data Parallel Model Parallelism Tensor Parallelism Pipeline Parallelism Fully Sharded Data Parallel ZeRO Optimization Gradient Checkpointing Distributed Checkpoint DeepSpeed 실험 관리 모델 및 데이터 버전 관리 학습 로그 관리 배포 후 성능 모니터링 Data Drift와 Model Drift 재학습 파이프라인 A/B Test Canary Deployment 모델 롤백
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.