본문으로 바로가기
LLM 양자화와 QLoRA
LinkedInGitHub
WORKSPACE

EXPLORER

157 POSTS
BLOG
면접질문
해야하는 거
AI 시대, 개발자는 사라지는가?
Python Counter, 빈도수를 쉽게 세는 방법
정렬
1. 투 포인터
DFS와 BFS
알고리즘 논리
코딩 테스트 핵심 알고리즘 정리파이썬 딕셔너리와 코딩 테스트 활용
예시로 살펴보는 AXAX 프로젝트, 문제 정의부터 확산까지AX 시대의 가치 정의와 현장 리딩
MSA
1. Singleton PatternSOLID
Kafka의 핵심 설계 원리Kafka 메시징 시스템의 구성과 동작 방식Kafka 기본 개념과 EC2 Docker 구성
쿠버네티스 입문
Modular Monolith1. MonolithMSA, 서비스 분리와 운영의 원리
Socket이란 무엇인가
네크워크 참조 모델
전체 데이터 구조REST API의 개념과 설계 원칙2. Field/ Parameter / Argument/ this
Actuator 란?EntityManagerJPA 연관관계 매핑JPA 트랜잭션(Transaction)입력값 검증Java의 AOP(Aspect Oriented Programming)Async : AsynchronousBeanJPA(Java Persistence API)Proxy 패턴Spring MVCdocker container1. Spirng 필요컴포넌트 스캔
Spring 컨테이너
application.yamlLombok
이번 강의는 무엇을 노리고 있을까?Spring AI를 배우기 전에 정리할 것23
1. 기술 스택
개발 문서를 읽기 위한 핵심 기술 용어
Docker를 이해하기 위한 운영체제 기초
sigterm
6. 설정과 저장소, 앱을 운영할 수 있는 상태로 만들기5. Service와 Ingress, 요청은 어디로 흐를까4. 직접 실험하는 Kubernetes, Pod 복구부터 롤백까지3. kubectl과 Pod, 상태에서 원인을 찾는 법2. 클러스터는 명령을 어떻게 Pod로 바꿀까1. 쿠버네티스, 원하는 상태와 컨테이너 이미지Calico쿠버네티스 입문, 원하는 상태를 유지하는 시스템
Psql JSONB, 행 잠금, 멱등성Psql 함수,프로시져,트리거
머신러닝 입문딥러닝 학습 기본 개념데이터 시각화기초 통계와 ML 파이프라인 연결분석 자동화와 파이프라인 설계
CNN 아키텍처 발전 과정이미지 세그멘테이션 모델과 핵심 개념객체 탐지 모델과 핵심 개념
딥러닝 데이터셋 엔지니어링
딥러닝 학습 문제 진단과 디버깅
도메인 적응 방법현대 LLM 워크플로의 패턴
Transformer에서 LoRA 적용 대상 정하기LoRA (Low-Rank Adaptation)
LLM 양자화와 QLoRA
분산 학습과 MLOps딥러닝 모델 경량화와 추론 최적화딥러닝 기본 학습 테크닉딥러닝 중급 학습 테크닉
Mixture of Experts(MoE) 핵심 개념멀티모달 파운데이션 모델 핵심 개념State Space Model과 MambaTransformer와 Vision Transformer
Latent Space
1Chunking?
DevOps 기초 1편
실습에서는?Agile 개요, 왜 필요한가?
CI/CD 기초 4편: 배포 전략과 운영CI/CD 기초 3편: Jenkins와 Argo CD를 이용한 GitOps 배포CI/CD 기초 2편: Docker 이미지와 배포 파이프라인CI/CD 기초 1편: 개념과 GitHub Actions
OCI: 컨테이너 이미지와 런타임의 공통 표준Docker 기초 13편: Compose Healthcheck와 실전 구성Docker 기초 12편: Compose 네트워크와 VolumeDocker 기초 11편: Compose 명령어와 환경 변수Docker 기초 10편: Compose 기본 구조와 이미지 빌드Docker 기초 9편: Docker 및 Kubernetes 네트워크Docker 기초 8편: 컨테이너 런타임과 격리Docker 기초 7편: 이미지 Layer와 tar 내부 구조Docker 기초 6편: 이미지 Layer와 빌드 최적화Docker 기초 5편: 컨테이너 기본 명령어와 VolumeDocker 기초 4편: 가상화와 컨테이너 이미지 생명주기Docker 기초 3편: CI/CD 연결과 배포 원칙Docker 기초 2편: Layer, Registry, Volume과 NetworkDocker 기초 1편: Dockerfile, Image와 Container
NginxNginx 로드 밸런싱과 HTTPSNginx 리버스 프록시와 Spring Boot 연결Nginx 기초와 동작 구조
05. Pinia 상태 관리: store 설계와 사용법04. Vue 컴포넌트 설계: props, emit, slot과 생명주기03. Vue Composition API 정리02. Vue 기초 문법 점검: JavaScript, 템플릿01. Vue.js 입문: 핵심 구조와 렌더링
Java 심화 Part 3: 함수형 프로그래밍과 LambdaJava 심화 Part 2: AnnotationJava 심화 Part 1: Reflection
Java 기초 Part 5: Stream APIJava 기초 Part 4: 제네릭Java 기초 Part 3: 제어문Java 기초 Part 2: 주석과 JavadocJava 기초 Part 1: 백엔드 배경과 Java 실행 구조
Java 디버깅 Part 1: 자주 헷갈리는 핵심 개념Java 디버깅 Part 2: VS Code 자동 컴파일과 프로젝트 구조
Java 실행과 JVM Part 3: ClassLoader와 JVM 메모리Java 실행과 JVM Part 2: 메모리와 데이터 흐름Java 실행과 JVM Part 1: Java와 Python 컴파일 비교
Java 객체지향 Part 5: static 메서드와 중첩 클래스Java 객체지향 Part 4: 상속과 인터페이스Java 객체지향 Part 3: 좋은 설계와 OOP 4대 특성Java 객체지향 Part 2: OOP 핵심 문법Java 객체지향 Part 1: 클래스, 객체, 필드와 생성자
Spring 기초 Part 11: Actuator와 애플리케이션 모니터링Spring 기초 Part 10: 비동기 처리와 @AsyncSpring 기초 Part 9: JPA 트랜잭션과 동시성 제어Spring 기초 Part 8: AOP와 공통 관심사 분리Spring 기초 Part 7: Proxy 패턴과 Spring ProxySpring 기초 Part 6: JPA 연관관계 매핑Spring 기초 Part 5: EntityManager와 영속성 컨텍스트Spring 기초 Part 4: JPA, Entity와 RepositorySpring 기초 Part 3: REST API 요청값과 입력값 검증Spring 기초 Part 2: Spring MVC 요청 처리 흐름Spring 기초 Part 1: IoC, Bean, DI와 주요 Annotation
DNS = Domain Name System
Spring Boot, WebSocket, Vue, Docker 로 Raspberry Pi 실시간 모니터링 프로젝트 만들기 - 1편1. Spring Boot 구현
1. GitHub Project 만들기
Python 코드 품질: 디버깅부터 테스트와 자동화까지Python 01. 실행 구조와 실무 기초
sLLM 핵심 기술과 전체 구조제한된 자원에서 sLLM 구축하기
시대 단상에 대한 주저리주저리
WORKSPACE

SEARCH

제목, 카테고리와 태그로 검색하세요.

VERSION CONTROL

SOURCE CONTROL

masterGitHub Pages
저장소 열기
BUILD STATUS

RUN AND DEBUG

게시물은 GitHub Actions에서 검증하고 정적 페이지로 빌드합니다.

Actions 열기
WORKSPACE

MANAGE

홈 열기전체 게시물태그 보기블로그 소개
LLM 양자화와 QLoRA●
workspace>posts>deep learning>optimization>quantization.md
Deep Learning / Optimization2026.08.311 min read5 tags

LLM 양자화와 QLoRA

LLM 양자화의 기본 원리와 Block-wise Quantization, NF4, Double Quantization, QLoRA의 학습 구조를 정리한다.

QUICK SUMMARY

핵심 요약

가중치를 저비트로 근사하는 과정부터 QLoRA가 메모리를 절감하는 방식까지 정리한다.

1. 양자화

모델의 실수형 가중치를 더 적은 비트 수의 숫자로 근사해서 저장하는 것이다.

원래 LLM 가중치가 FP16이라면 가중치 하나를 16비트로 저장한다.

(0.1274,\quad -1.3821,\quad 0.7362)

4bit로 양자화하면 사용할 수 있는 값이 (2^4=16)개밖에 없으니까, 원래 연속적인 실수를 16개의 대표값 중 하나로 매핑하게 된다.

가장 기본적인 양자화 원리는 다음과 같다.

예를 들어 가중치 범위가

[ -1.0 \sim 1.0 ]

이고 4bit를 사용한다고 해보자. 4bit면 표현 가능한 정수는 0부터 15까지다.

총 16개다.

그러면 실수 (x)를 정수 (q)로 바꾸는 가장 단순한 방식은 대략

[ q = \operatorname{round}\left(\frac{x-x_{\min}}{s}\right) ]

처럼 표현할 수 있다.

여기서 (s)는 Scale이다.

[ s=\frac{x_{\max}-x_{\min}}{2^b-1} ]

(b=4)라면

[ s =\frac{1-(-1)}{15} =\frac{2}{15} \approx 0.1333 ]

이다.

[ x=0.72 ]

가 된다.

즉,

원래 값
  0.72

  ↓ Quantization

4bit Integer
  13

으로 저장하는 것이다.

그런데 계산할 때 13을 그대로 쓰는 것은 아니다

필요할 때 다시 근사적인 실수로 복원한다.

이를 Dequantization이라고 한다.

[ \hat{x}=q \times s+x_{\min} ]

방금 값이라면

[ 13\times0.1333-1\approx0.733 ]

이다.

원래 값은 (0.72)였는데 복원하면

[ 0.733 ]

정도가 된다. 즉,

[ 0.72\rightarrow 13\rightarrow 0.733 ]

이다. 이 차이를 Quantization Error라고 한다.

[ \text{Error}=0.733-0.72=0.013 ]

그래서 양자화의 본질은 정밀도를 조금 포기해서 메모리와 계산 비용을 크게 줄이는 것이다.

왜 메모리가 줄어드나?

7B 모델이 있다고 해보자. FP16이라면 Parameter 하나당

[ 16\text{bit}=2\text{byte} ]

이므로 대략

[ 7\text{B}\times2\text{byte}\approx14\text{GB} ]

가 필요하다. 4bit라면

[ 4\text{bit}=0.5\text{byte} ]

이므로 이론적으로

[ 7\text{B}\times0.5\text{byte}\approx3.5\text{GB} ]

정도까지 줄어든다.

그래서

FP32
  32bit

  ↓

FP16 / BF16
  16bit

  ↓

INT8
  8bit

  ↓

INT4
  4bit

로 내려갈수록 메모리가 줄어든다.

그런데 실제 LLM은 전체 Weight를 한 번에 양자화하지 않는다

여기서 중요한 개념이 Block-wise Quantization이다.

가중치가 엄청 큰 행렬이라고 해보자.

[ W\in\mathbb{R}^{4096\times4096} ]

이 전체 행렬 하나에 Scale 하나만 쓰면 문제가 생긴다.

예를 들어 대부분의 Weight가

[ -0.1\sim0.1 ]

사이에 있는데 딱 하나가

[ 5.0 ]

이라면 전체 범위가

[ -0.1\sim5.0 ]

이 되어버린다.

그러면 작은 Weight들이 매우 부정확하게 표현된다. 그래서 실제로는 Weight를 작은 Block으로 나눈다.

거대한 Weight

  [----------------------------]

  ↓

Block 1
  [----]

Block 2
  [----]

Block 3
  [----]

Block 4
  [----]

그리고 각 Block마다 별도의 Scale을 갖는다.

Block 1 → Scale₁
Block 2 → Scale₂
Block 3 → Scale₃
Block 4 → Scale₄

이렇게 하면 각 지역의 숫자 분포에 더 잘 맞출 수 있다.

QLoRA는 조금 더 특별하다

QLoRA에서는 그냥 일반적인 INT4를 사용하는 것이 아니라 대표적으로 NF4, 즉 NormalFloat 4-bit를 사용한다. LLM Weight를 보면 대체로 값들이 정규분포와 비슷하게 몰려 있는 경우가 많다.

빈도

          ███
        ███████
      ███████████
----███████████████----
             0

즉 0 근처에 Weight가 많고 큰 값은 적다. 일반적인 균등 양자화라면 값을 일정한 간격으로 나눈다.

-1
│
├── -0.75
├── -0.50
├── -0.25
├──  0
├──  0.25
├──  0.50
├──  0.75
│
1

하지만 Weight가 0 근처에 몰려 있다면 0 근처에 더 많은 표현값을 배치하는 것이 효율적일 수 있다.

NF4는 이런 신경망 Weight의 분포 특성에 맞춰 16개의 대표값을 설계한다.

Uniform INT4

  |----|----|----|----|----|


NF4

  |-------|---|-|-|-|---|-------|
                0

처럼 0 근처를 더 세밀하게 표현한다고 이해하면 된다. 엄밀하게는 정규분포를 고려해 Quantization Level을 설계한 데이터 타입이다.

QLoRA에서 학습은 어떻게 되는 걸까?

QLoRA라고 해서 모든 연산을 4bit로 하는 것은 아니다. Base Model의 Weight는 4bit로 저장한다.

하지만 실제 Matrix Multiplication을 할 때는 다음과 같다.

4bit Weight
  ↓
Dequantization
  ↓
BF16 / FP16
  ↓
Matrix Multiplication

그리고 LoRA Adapter는 보통 더 높은 정밀도로 학습한다. 구조적으로는 이런 느낌이다.

                 Base Model Weight
                          W
                        4bit
                          │
                    Dequantization
                          │
                          ↓
x ────────────────────── Wx
│                         │
│                         ├──→ +
│                         │     │
└──→ LoRA A → LoRA B ──────────┘
      BF16      BF16             │
                                 ↓
                                 y

[ y=W_{\text{quantized}}x+\frac{\alpha}{r}BAx ]

정확하게는 계산할 때 양자화된 (W)가 적절한 계산 dtype으로 복원되어 사용된다.

그런데 Base Model은 4bit인데 학습이 가능한 이유는?

QLoRA에서는 Base Weight를 Frozen 상태로 유지한다.

즉,

[ W ]

를 업데이트하지 않는다. Gradient가 필요한 것은

[ A, B ]

뿐이다.

Forward

Quantized W
  +
LoRA A, B
  ↓
Prediction
  ↓
Loss

Backward

W → 업데이트 ❌
A → Gradient ✅
B → Gradient ✅

그래서 LoRA 대비 메모리 절감이 가능해진다.

Double Quantization

QLoRA에서 재미있는 기술 중 하나다.

아까 Block마다 Scale이 필요하다고 했다. 그런데 Scale도 결국 숫자다.

Block 1 → scale = 0.03451
Block 2 → scale = 0.02137
Block 3 → scale = 0.04282
...

Block이 많으면 Scale 저장 비용도 무시할 수 없게 된다.

그래서 QLoRA는

Quantization을 위한 Scale 자체를 다시 Quantization

한다.

Weight
  ↓
4bit Quantization
  ↓
Scale 필요

그 Scale
  ↓
다시 Quantization

QLoRA

Base LLM
  FP16 / BF16
      │
      ↓
4bit Quantization
      │
      ├── NF4
      ├── Block-wise Quantization
      └── Double Quantization
      │
      ↓
Quantized Base Model
  Frozen
      │
      +
      │
LoRA Adapter
  A, B
  Trainable
      │
      ↓
Fine-Tuning

그리고 추론할 때는 다음과 같다.

[ \boxed{y=Wx+\frac{\alpha}{r}BAx} ]

기본 구조는 유지된다.

다만, (W)가 고정밀 원본 Weight가 아니라 4bit로 압축 저장된 Weight라는 것이 핵심적인 차이다.

양자화는 Weight를 단순히 소수점 몇 자리에서 잘라버리는 것이 아니다. 여러 실수값을 제한된 수의 대표값에 매핑하고, Scale 등의 정보를 이용해서 필요할 때 근사 복원하는 과정이다.

TAGS#Deep Learning#LLM#Quantization#QLoRA#NF4
PREVIOUSDFS와 BFSNEXT도메인 적응 방법
DISCUSSION

COMMENTS

GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.

GitHub 로그인 후 댓글 쓰기Discussion 열기
DOCUMENT STRUCTURE

이 문서에는 목차가 없습니다.

DOCUMENT INFO
TYPE
Markdown
DATE
2026.08.31
READ
1 min read
WORDS
0
CATEGORY
Deep Learning / Optimization
RELATED DOCUMENTS
도메인 적응 방법LoRA (Low-Rank Adaptation)현대 LLM 워크플로의 패턴딥러닝 모델 경량화와 추론 최적화머신러닝 입문Transformer에서 LoRA 적용 대상 정하기
main Deep Learning / Optimization
1 min readUTF-8Markdown
본문 글씨 크기
RECENTLY OPENED1
LLM 양자화와 QLoRArecently opened