Transformer에서 LoRA 적용 대상 정하기
Transformer의 Attention과 MLP에서 LoRA를 적용할 Projection과 적용 범위를 정리한다.
v_proj
Wv + ΔWv
16. 처음에는 왜 q_proj와 v_proj 이야기가 많이 나오는가
원래 LoRA 논문에서는 Attention의 특정 Projection에 LoRA를 적용하는 실험을 많이 했다.
그래서 흔히
q_proj v_proj
에 적용하는 설정을 볼 수 있다.
현재 LLM Fine-Tuning에서는 좀 더 넓게
q_proj k_proj v_proj o_proj
gate_proj up_proj down_proj
쉽게 이야기 해서
Attention만 수정
vs
Attention + MLP까지 수정
일단 당장은 추가하지 말고, MSA부터 추가하자
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.