[{"data":1,"prerenderedAt":38},["ShallowReactive",2],{"post-document:\u002Fdeep_learning\u002Ftransformer\u002F2026\u002F08\u002F06\u002Fmultimodal-foundation-models\u002F":3},{"id":4,"title":5,"body":6,"categories":17,"date":20,"description":21,"extension":22,"image":23,"key_concepts":23,"last_modified_at":23,"legacyPath":24,"meta":25,"navigation":27,"part":23,"path":28,"published":27,"robots":23,"seo":29,"series":23,"stem":30,"strengths":23,"summary":31,"tags":32,"tradeoffs":23,"__hash__":37},"posts\u002Fposts\u002FDeep_Learning\u002FTransformer\u002F2026-08-06-multimodal-foundation-models.md","멀티모달 파운데이션 모델 핵심 개념",{"type":7,"value":8,"toc":13},"minimark",[9],[10,11,12],"p",{},"Foundation Model이란 무엇인가\nMultimodal Model이란 무엇인가\nCLIP의 이미지–텍스트 정렬\nVision Encoder와 Language Model 연결\nMultimodal Projector\nImage Token\nVision Language Model 구조\nVLM Fine-tuning\nMultimodal Instruction Tuning\nVisual Question Answering\nImage Captioning\nOpen-vocabulary Recognition\nMultimodal RAG\nVideo Language Model\nVision-Language-Action Model\nAny-to-Any Model\nMultimodal Agent\nUnified Understanding and Generation",{"title":14,"searchDepth":15,"depth":15,"links":16},"",2,[],[18,19],"Deep_Learning","Transformer","2026-08-06 00:00:00 +0900","Foundation Model부터 CLIP, VLM, Multimodal RAG, Vision-Language-Action Model까지 멀티모달 모델의 핵심 개념을 정리한다.","md",null,"\u002Fdeep_learning\u002Ftransformer\u002F2026\u002F08\u002F06\u002Fmultimodal-foundation-models\u002F",{"layout":26},"post",true,"\u002Fposts\u002Fdeep_learning\u002Ftransformer\u002F2026-08-06-multimodal-foundation-models",{"title":5,"description":21},"posts\u002FDeep_Learning\u002FTransformer\u002F2026-08-06-multimodal-foundation-models","이미지와 언어를 함께 처리하는 멀티모달 파운데이션 모델의 구조와 주요 학습 주제를 정리한다.",[33,34,35,36],"Deep Learning","Multimodal","Foundation Model","Vision Language Model","jJzr4QYeRz4ohvFKxZ2tzSZPf3hFyljCS3MxcZRZLkE",1788744789248]