Transformer와 Vision Transformer
Transformer의 기본 구조와 Self-Attention, Vision Transformer, Swin Transformer, DETR의 흐름을 정리한다.
Transformer 기본 Transformer가 등장한 이유 Token과 Embedding Self-Attention의 직관 Multi-Head Attention Positional Encoding Encoder와 Decoder Masked Attention KV Cache Pre-training과 Fine-tuning Context Length
Vision Transformer 이미지를 Patch로 나누는 이유 CNN과 ViT 비교 ViT의 전체 데이터 흐름 Swin Transformer의 Window Attention Hierarchical Vision Transformer Hybrid CNN–Transformer DETR Mask Transformer Vision Foundation Model Self-supervised Vision Model
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.