제한된 자원에서 sLLM 구축하기
LoRA와 QLoRA, 양자화, KV Cache와 RAG를 조합해 제한된 자원에서 sLLM을 구축하는 방법을 정리한다.
예시
Base 모델: Qwen2.5-1.5B 학습 대상: 연차·재택근무 질문 200개 검색 문서: 최신 인사 규정 PDF 목표: 3초 이내에 근거가 포함된 정확한 답변
서비스를 만드르 때 다음 순서로 연결
LoRA/QLoRA로 모델 적응 ↓ Quantization/KV Cache로 빠르게 배포 ↓ 정확도, 근거성, 환각, 속도, 비용 측정 ↓ 작은 시나리오에서 RAG와 Fine-Tuning 비중 조정
1. 제한한 자원에서는 LoRA 또는 QLoRA 사용
Full Fine-Tuning은 모델의 거의 모든 파라미터를 수정
GPU 메모리에는 모델 가중치, Gradient, Optimizer, 중간 연산 결과, 입력 데이터
등이 전부 GPU 메모리에 올라가야 한다.
따라서 모델 파일은 실행되더라도, 학습 과정에서는 메모리가 부족할 수 있다.
LoRA와 QLoRA는 이 문제를 줄이는 방법
LoRA의 동작 방식
LoRA는 원래 모델을 고정하고, 모델의 일부 계층에 작은 추가 행렬을 붙인다.
Base 모델 파라미터 : 고정 LoRA Adapter: 학습
예를 들어 원래 모델에 다음과 같은 능력이 있다고 가정
사용자: 연차는 어떻게 신청해? Base 모델: 회사의 연차 정책을 확인하고 담당자에게 문의하세요.
HR 질문과 모범 답변을 LoRA로 학습하면 다음과 같은 응답 방식에 적응시킬 수 있음
사용자: 연차는 어떻게 신청해? LoRA 모델:
- 그룹웨어의 근태 메뉴에 접속합니다.
- 사용일 3일 전까지 신청합니다.
- 팀장 승인을 받아야 합니다.
Base 모델 전체를 바꾸지 않고도 다음 요소를 학습
- 사내 용어
- 답변 순서
- 응답 형식
- 업무별 판단 패터
- 모르는 내용에 대한 처리 방식
LoRA가 적합한 경우
- FP16 또는 BF16 Base 모델을 GPU에 올릴 수 있음
- 학습 안정성과 설정의 단순성이 중요함
- 비교적 작은 모델을 학습함
- MPS 기반 Mac 또는 다양한 환경에서 실습함
QLoRA의 동작 방식
QLoRA는 Base 모델을 4비트로 압축해서 메모리에 올리고, 그 위에 LoRA Adapter를 학습
4비트 Base 모델: 고정 LoRA Adapter: 학습
LoRA보다 Base 모델이 차지하는 메모리가 작기 때문에 더 큰 모델을 제한된 GPU에서 학습
| 방식 | Base 모델 저장 정밀도 | 학습 대상 | 메모리 |
|---|---|---|---|
| Full Fine-Tuning | FP16/BF16 | 전체 모델 | 매우 큼 |
| LoRA | FP16/BF16 | 작은 Adapter | 작음 |
| QLoRA | 주로 4bit | 작은 Adapter | 더 작음 |
정확한 메모리 사용량은 모델 구조, 시퀀스 길이, 배치 크기, Optimizer 등에 따라 달라진다.
LoRA를 먼저 선택
- 현재 GPU에서 Base 모델 로딩과 학습이 가능함
- 구현 복잡도를 낮추고 싶음
- Mac MPS나 CPU 환경도 고려해야 함
- 양자화로 인한 추가 변수를 피하고 싶음
QLoRA를 선택
- CUDA GPU가 있지만 VRAM이 부족함
- LoRA 방식으로도 모델이 메모리에 들어가지 않음
- 더 큰 Base 모델을 사용해야 함
- 4비트 학습을 지원하는 라이브러리 환경이 준비됨
LoRA 실행 가능 여부 확인 → 메모리 부족 발생 → 배치 크기와 시퀀스 길이 축소 → Gradient Accumulation 적용 → 그래도 부족하면 QLoRA 검토
2. 배포 단계에서 Quantization 과 KV Cache를 최적화한다.
LoRA와 QLoRA는 주로 모델을 어떻게 학습할 것인지에 관한 기술, Quantization과 KV cache 최적화는 학습이 끝난 모델 어떻게 빠르게실행할 것인지에 관한 내용
Quantization
Quantization은 모델이 사용하는 숫자의 정밀도를 낮추는 방법
FP32 → FP16/BF16 → INT8 → INT4
숫자 하나를 저장하는데 필요한 비트가 줄어들면 다음 효과가 생긴다.
- 모델 메모리 감소
- 더 작은 GPU에서 실행 가능
- 메모리 대역폭 사용 감소
- 환경에 따라 추론 속도 향상
- 동시 요청 처리량 증가 가능
FP16 모델 크기: 약 3GB INT8 모델 크기: 약 1.5GB INT4 모델 크기: 약 0.75GB
다만, 낮은 비트가 항상 빠른 것운 아님
INT4로 줄였다고 반드시 모든 환경에서 빨라지는 것은 아니다.
- 해당 하드웨어가 INT4 연산을 잘 지원하는가?
- 실행 엔진이 해당 양자화 형식을 지원하는가?
- 양자화 해제 비용이 얼마나 드는가?
- 배치 크기가 얼마인가?
- CPU, NVIDIA GPU, Apple Silicon 중 어디서 실행하는가?
그리고 문제가 하나 더 있다.
Quantization의 정확도 손실이다.
정질도를 낮추면 일부 가중치가 손실된다. 따라서 배포 전후에 동일 질문으로 품질을 비교해야 한다.
뭐 예시로 좀 보자면
FP16 모델 사용자: 연차 신청 기한은? 답변: 사용일 3일 전까지 신청해야 합니다.
INT4 모델 사용자: 연차 신청 기한은? 답변: 사용일 전에 신청해야 합니다.
양자화 전후에 특히 확인해야 할 항목은 다음과 같다.
- 숫자와 날짜
- 고유 명사
- 부정 표현
- 전문 용어
- 긴 답변의 일관성
- JSON등 구조화된 출력 방식
KV Cache
언어모델은 답변을 한 번에 완성하지 않고, 토큰을 하나씩 생성한다.
"연차" "연차 신청" "연차 신청은" "연차 신청은 그룹웨어에서"
새 토큰을 만들 때마다 이전 토큰들의 Attention 계산을
COMMENTS
GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.