딥러닝 데이터셋 엔지니어링
데이터 분리, 불균형, 증강, 라벨 노이즈, 중복 데이터와 데이터셋 버전 관리 방법을 정리한다.
좋은 데이터셋의 조건 Class Imbalance란 무엇인가 Train과 Validation 데이터 누수를 방지하는 방법 이미지 크기를 통일해야 하는 이유 Normalization과 Standardization Data Augmentation 기본 데이터 증강을 많이 하면 항상 좋은가 Label Noise가 성능에 미치는 영향 잘못된 라벨을 찾는 방법 Duplicate Image가 평가 결과를 왜곡하는 이유 Stratified Split과 Group Split 실제 환경을 반영한 데이터 분리 전략 Hard Example Mining Synthetic Data 활용 방법 데이터셋 버전 관리
모델 성능이 안 나올 때 모델부터 바꾸면 안 되는 이유 mAP가 높은데 실제 영상에서는 탐지가 안 되는 이유 데이터 증강이 오히려 성능을 떨어뜨리는 경우 Validation 성능은 좋은데 Test 성능이 낮은 이유
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.