[{"data":1,"prerenderedAt":38},["ShallowReactive",2],{"post-document:\u002Fdeep_learning\u002Ftechnics\u002F2026\u002F08\u002F06\u002Fmodel-optimization\u002F":3},{"id":4,"title":5,"body":6,"categories":17,"date":20,"description":21,"extension":22,"image":23,"key_concepts":23,"last_modified_at":23,"legacyPath":24,"meta":25,"navigation":27,"part":23,"path":28,"published":27,"robots":23,"seo":29,"series":23,"stem":30,"strengths":23,"summary":31,"tags":32,"tradeoffs":23,"__hash__":37},"posts\u002Fposts\u002FDeep_Learning\u002FTechnics\u002F2026-08-06-model-optimization.md","딥러닝 모델 경량화와 추론 최적화",{"type":7,"value":8,"toc":13},"minimark",[9],[10,11,12],"p",{},"모델 파라미터 수와 실제 속도는 같은가\nFLOPs와 Latency의 차이\nQuantization 기본\nFP32, FP16, BF16, INT8\nPost-Training Quantization\nQuantization-Aware Training\nDynamic과 Static Quantization\nPer-tensor와 Per-channel Quantization\nPruning\nStructured와 Unstructured Pruning\n2:4 Sparsity\nKnowledge Distillation\nLow-rank Decomposition\nONNX 변환\nTensorRT 최적화\nOperator Fusion\nBatch Inference\nEdge Deployment\nCPU, GPU, NPU 추론 비교\n모델 정확도–속도 Trade-off",{"title":14,"searchDepth":15,"depth":15,"links":16},"",2,[],[18,19],"Deep_Learning","Technics","2026-08-06 00:00:00 +0900","Quantization, Pruning, Knowledge Distillation, ONNX, TensorRT 등 모델 경량화와 추론 최적화 기법을 정리한다.","md",null,"\u002Fdeep_learning\u002Ftechnics\u002F2026\u002F08\u002F06\u002Fmodel-optimization\u002F",{"layout":26},"post",true,"\u002Fposts\u002Fdeep_learning\u002Ftechnics\u002F2026-08-06-model-optimization",{"title":5,"description":21},"posts\u002FDeep_Learning\u002FTechnics\u002F2026-08-06-model-optimization","딥러닝 모델의 정확도와 추론 속도를 함께 고려하는 경량화 기법을 정리한다.",[33,34,35,36],"Deep Learning","Model Optimization","Quantization","Pruning","bgTjAv71fL1M9jTHiYRsW_rJZoYkvjJBLfLNRAMQYtY",1788744789130]