[{"data":1,"prerenderedAt":40},["ShallowReactive",2],{"post-document:\u002Fdeep_learning\u002Fdata\u002F2026\u002F08\u002F06\u002Fdataset-engineering\u002F":3},{"id":4,"title":5,"body":6,"categories":20,"date":23,"description":24,"extension":25,"image":26,"key_concepts":26,"last_modified_at":26,"legacyPath":27,"meta":28,"navigation":30,"part":26,"path":31,"published":30,"robots":26,"seo":32,"series":26,"stem":33,"strengths":26,"summary":34,"tags":35,"tradeoffs":26,"__hash__":39},"posts\u002Fposts\u002FDeep_Learning\u002FData\u002F2026-08-06-dataset-engineering.md","딥러닝 데이터셋 엔지니어링",{"type":7,"value":8,"toc":16},"minimark",[9,13],[10,11,12],"p",{},"좋은 데이터셋의 조건\nClass Imbalance란 무엇인가\nTrain과 Validation 데이터 누수를 방지하는 방법\n이미지 크기를 통일해야 하는 이유\nNormalization과 Standardization\nData Augmentation 기본\n데이터 증강을 많이 하면 항상 좋은가\nLabel Noise가 성능에 미치는 영향\n잘못된 라벨을 찾는 방법\nDuplicate Image가 평가 결과를 왜곡하는 이유\nStratified Split과 Group Split\n실제 환경을 반영한 데이터 분리 전략\nHard Example Mining\nSynthetic Data 활용 방법\n데이터셋 버전 관리",[10,14,15],{},"모델 성능이 안 나올 때 모델부터 바꾸면 안 되는 이유\nmAP가 높은데 실제 영상에서는 탐지가 안 되는 이유\n데이터 증강이 오히려 성능을 떨어뜨리는 경우\nValidation 성능은 좋은데 Test 성능이 낮은 이유",{"title":17,"searchDepth":18,"depth":18,"links":19},"",2,[],[21,22],"Deep_Learning","Data","2026-08-06 00:00:00 +0900","데이터 분리, 불균형, 증강, 라벨 노이즈, 중복 데이터와 데이터셋 버전 관리 방법을 정리한다.","md",null,"\u002Fdeep_learning\u002Fdata\u002F2026\u002F08\u002F06\u002Fdataset-engineering\u002F",{"layout":29},"post",true,"\u002Fposts\u002Fdeep_learning\u002Fdata\u002F2026-08-06-dataset-engineering",{"title":5,"description":24},"posts\u002FDeep_Learning\u002FData\u002F2026-08-06-dataset-engineering","딥러닝 성능을 좌우하는 데이터셋 구성과 검증 방법을 정리한다.",[36,37,38],"Deep Learning","Dataset Engineering","Data Augmentation","BcPu5-owVcSEy00ufdgKwSTN5upRrt3IukW1OmgvRVY",1788744788769]