멀티모달 파운데이션 모델 핵심 개념
Foundation Model부터 CLIP, VLM, Multimodal RAG, Vision-Language-Action Model까지 멀티모달 모델의 핵심 개념을 정리한다.
Foundation Model이란 무엇인가 Multimodal Model이란 무엇인가 CLIP의 이미지–텍스트 정렬 Vision Encoder와 Language Model 연결 Multimodal Projector Image Token Vision Language Model 구조 VLM Fine-tuning Multimodal Instruction Tuning Visual Question Answering Image Captioning Open-vocabulary Recognition Multimodal RAG Video Language Model Vision-Language-Action Model Any-to-Any Model Multimodal Agent Unified Understanding and Generation
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.