본문으로 바로가기
제한된 자원에서 sLLM 구축하기
LinkedInGitHub
WORKSPACE

EXPLORER

157 POSTS
BLOG
면접질문
해야하는 거
AI 시대, 개발자는 사라지는가?
Python Counter, 빈도수를 쉽게 세는 방법
정렬
1. 투 포인터
DFS와 BFS
알고리즘 논리
코딩 테스트 핵심 알고리즘 정리파이썬 딕셔너리와 코딩 테스트 활용
예시로 살펴보는 AXAX 프로젝트, 문제 정의부터 확산까지AX 시대의 가치 정의와 현장 리딩
MSA
1. Singleton PatternSOLID
Kafka의 핵심 설계 원리Kafka 메시징 시스템의 구성과 동작 방식Kafka 기본 개념과 EC2 Docker 구성
쿠버네티스 입문
Modular Monolith1. MonolithMSA, 서비스 분리와 운영의 원리
Socket이란 무엇인가
네크워크 참조 모델
전체 데이터 구조REST API의 개념과 설계 원칙2. Field/ Parameter / Argument/ this
Actuator 란?EntityManagerJPA 연관관계 매핑JPA 트랜잭션(Transaction)입력값 검증Java의 AOP(Aspect Oriented Programming)Async : AsynchronousBeanJPA(Java Persistence API)Proxy 패턴Spring MVCdocker container1. Spirng 필요컴포넌트 스캔
Spring 컨테이너
application.yamlLombok
이번 강의는 무엇을 노리고 있을까?Spring AI를 배우기 전에 정리할 것23
1. 기술 스택
개발 문서를 읽기 위한 핵심 기술 용어
Docker를 이해하기 위한 운영체제 기초
sigterm
6. 설정과 저장소, 앱을 운영할 수 있는 상태로 만들기5. Service와 Ingress, 요청은 어디로 흐를까4. 직접 실험하는 Kubernetes, Pod 복구부터 롤백까지3. kubectl과 Pod, 상태에서 원인을 찾는 법2. 클러스터는 명령을 어떻게 Pod로 바꿀까1. 쿠버네티스, 원하는 상태와 컨테이너 이미지Calico쿠버네티스 입문, 원하는 상태를 유지하는 시스템
Psql JSONB, 행 잠금, 멱등성Psql 함수,프로시져,트리거
머신러닝 입문딥러닝 학습 기본 개념데이터 시각화기초 통계와 ML 파이프라인 연결분석 자동화와 파이프라인 설계
CNN 아키텍처 발전 과정이미지 세그멘테이션 모델과 핵심 개념객체 탐지 모델과 핵심 개념
딥러닝 데이터셋 엔지니어링
딥러닝 학습 문제 진단과 디버깅
도메인 적응 방법현대 LLM 워크플로의 패턴
Transformer에서 LoRA 적용 대상 정하기LoRA (Low-Rank Adaptation)
LLM 양자화와 QLoRA
분산 학습과 MLOps딥러닝 모델 경량화와 추론 최적화딥러닝 기본 학습 테크닉딥러닝 중급 학습 테크닉
Mixture of Experts(MoE) 핵심 개념멀티모달 파운데이션 모델 핵심 개념State Space Model과 MambaTransformer와 Vision Transformer
Latent Space
1Chunking?
DevOps 기초 1편
실습에서는?Agile 개요, 왜 필요한가?
CI/CD 기초 4편: 배포 전략과 운영CI/CD 기초 3편: Jenkins와 Argo CD를 이용한 GitOps 배포CI/CD 기초 2편: Docker 이미지와 배포 파이프라인CI/CD 기초 1편: 개념과 GitHub Actions
OCI: 컨테이너 이미지와 런타임의 공통 표준Docker 기초 13편: Compose Healthcheck와 실전 구성Docker 기초 12편: Compose 네트워크와 VolumeDocker 기초 11편: Compose 명령어와 환경 변수Docker 기초 10편: Compose 기본 구조와 이미지 빌드Docker 기초 9편: Docker 및 Kubernetes 네트워크Docker 기초 8편: 컨테이너 런타임과 격리Docker 기초 7편: 이미지 Layer와 tar 내부 구조Docker 기초 6편: 이미지 Layer와 빌드 최적화Docker 기초 5편: 컨테이너 기본 명령어와 VolumeDocker 기초 4편: 가상화와 컨테이너 이미지 생명주기Docker 기초 3편: CI/CD 연결과 배포 원칙Docker 기초 2편: Layer, Registry, Volume과 NetworkDocker 기초 1편: Dockerfile, Image와 Container
NginxNginx 로드 밸런싱과 HTTPSNginx 리버스 프록시와 Spring Boot 연결Nginx 기초와 동작 구조
05. Pinia 상태 관리: store 설계와 사용법04. Vue 컴포넌트 설계: props, emit, slot과 생명주기03. Vue Composition API 정리02. Vue 기초 문법 점검: JavaScript, 템플릿01. Vue.js 입문: 핵심 구조와 렌더링
Java 심화 Part 3: 함수형 프로그래밍과 LambdaJava 심화 Part 2: AnnotationJava 심화 Part 1: Reflection
Java 기초 Part 5: Stream APIJava 기초 Part 4: 제네릭Java 기초 Part 3: 제어문Java 기초 Part 2: 주석과 JavadocJava 기초 Part 1: 백엔드 배경과 Java 실행 구조
Java 디버깅 Part 1: 자주 헷갈리는 핵심 개념Java 디버깅 Part 2: VS Code 자동 컴파일과 프로젝트 구조
Java 실행과 JVM Part 3: ClassLoader와 JVM 메모리Java 실행과 JVM Part 2: 메모리와 데이터 흐름Java 실행과 JVM Part 1: Java와 Python 컴파일 비교
Java 객체지향 Part 5: static 메서드와 중첩 클래스Java 객체지향 Part 4: 상속과 인터페이스Java 객체지향 Part 3: 좋은 설계와 OOP 4대 특성Java 객체지향 Part 2: OOP 핵심 문법Java 객체지향 Part 1: 클래스, 객체, 필드와 생성자
Spring 기초 Part 11: Actuator와 애플리케이션 모니터링Spring 기초 Part 10: 비동기 처리와 @AsyncSpring 기초 Part 9: JPA 트랜잭션과 동시성 제어Spring 기초 Part 8: AOP와 공통 관심사 분리Spring 기초 Part 7: Proxy 패턴과 Spring ProxySpring 기초 Part 6: JPA 연관관계 매핑Spring 기초 Part 5: EntityManager와 영속성 컨텍스트Spring 기초 Part 4: JPA, Entity와 RepositorySpring 기초 Part 3: REST API 요청값과 입력값 검증Spring 기초 Part 2: Spring MVC 요청 처리 흐름Spring 기초 Part 1: IoC, Bean, DI와 주요 Annotation
DNS = Domain Name System
Spring Boot, WebSocket, Vue, Docker 로 Raspberry Pi 실시간 모니터링 프로젝트 만들기 - 1편1. Spring Boot 구현
1. GitHub Project 만들기
Python 코드 품질: 디버깅부터 테스트와 자동화까지Python 01. 실행 구조와 실무 기초
sLLM 핵심 기술과 전체 구조제한된 자원에서 sLLM 구축하기
시대 단상에 대한 주저리주저리
WORKSPACE

SEARCH

제목, 카테고리와 태그로 검색하세요.

VERSION CONTROL

SOURCE CONTROL

masterGitHub Pages
저장소 열기
BUILD STATUS

RUN AND DEBUG

게시물은 GitHub Actions에서 검증하고 정적 페이지로 빌드합니다.

Actions 열기
WORKSPACE

MANAGE

홈 열기전체 게시물태그 보기블로그 소개
제한된 자원에서 sLLM 구축하기●
workspace>posts>sllm>resource-efficient-build.md
sLLM2026.08.281 min read5 tags

제한된 자원에서 sLLM 구축하기

LoRA와 QLoRA, 양자화, KV Cache와 RAG를 조합해 제한된 자원에서 sLLM을 구축하는 방법을 정리한다.

예시

Base 모델: Qwen2.5-1.5B 학습 대상: 연차·재택근무 질문 200개 검색 문서: 최신 인사 규정 PDF 목표: 3초 이내에 근거가 포함된 정확한 답변

서비스를 만드르 때 다음 순서로 연결

LoRA/QLoRA로 모델 적응 ↓ Quantization/KV Cache로 빠르게 배포 ↓ 정확도, 근거성, 환각, 속도, 비용 측정 ↓ 작은 시나리오에서 RAG와 Fine-Tuning 비중 조정

1. 제한한 자원에서는 LoRA 또는 QLoRA 사용

Full Fine-Tuning은 모델의 거의 모든 파라미터를 수정

GPU 메모리에는 모델 가중치, Gradient, Optimizer, 중간 연산 결과, 입력 데이터

등이 전부 GPU 메모리에 올라가야 한다.

따라서 모델 파일은 실행되더라도, 학습 과정에서는 메모리가 부족할 수 있다.

LoRA와 QLoRA는 이 문제를 줄이는 방법

LoRA의 동작 방식

LoRA는 원래 모델을 고정하고, 모델의 일부 계층에 작은 추가 행렬을 붙인다.

Base 모델 파라미터 : 고정 LoRA Adapter: 학습

예를 들어 원래 모델에 다음과 같은 능력이 있다고 가정

사용자: 연차는 어떻게 신청해? Base 모델: 회사의 연차 정책을 확인하고 담당자에게 문의하세요.

HR 질문과 모범 답변을 LoRA로 학습하면 다음과 같은 응답 방식에 적응시킬 수 있음

사용자: 연차는 어떻게 신청해? LoRA 모델:

  1. 그룹웨어의 근태 메뉴에 접속합니다.
  2. 사용일 3일 전까지 신청합니다.
  3. 팀장 승인을 받아야 합니다.

Base 모델 전체를 바꾸지 않고도 다음 요소를 학습

  • 사내 용어
  • 답변 순서
  • 응답 형식
  • 업무별 판단 패터
  • 모르는 내용에 대한 처리 방식

LoRA가 적합한 경우

  • FP16 또는 BF16 Base 모델을 GPU에 올릴 수 있음
  • 학습 안정성과 설정의 단순성이 중요함
  • 비교적 작은 모델을 학습함
  • MPS 기반 Mac 또는 다양한 환경에서 실습함

QLoRA의 동작 방식

QLoRA는 Base 모델을 4비트로 압축해서 메모리에 올리고, 그 위에 LoRA Adapter를 학습

4비트 Base 모델: 고정 LoRA Adapter: 학습

LoRA보다 Base 모델이 차지하는 메모리가 작기 때문에 더 큰 모델을 제한된 GPU에서 학습

방식Base 모델 저장 정밀도학습 대상메모리
Full Fine-TuningFP16/BF16전체 모델매우 큼
LoRAFP16/BF16작은 Adapter작음
QLoRA주로 4bit작은 Adapter더 작음

정확한 메모리 사용량은 모델 구조, 시퀀스 길이, 배치 크기, Optimizer 등에 따라 달라진다.

LoRA를 먼저 선택

  • 현재 GPU에서 Base 모델 로딩과 학습이 가능함
  • 구현 복잡도를 낮추고 싶음
  • Mac MPS나 CPU 환경도 고려해야 함
  • 양자화로 인한 추가 변수를 피하고 싶음

QLoRA를 선택

  • CUDA GPU가 있지만 VRAM이 부족함
  • LoRA 방식으로도 모델이 메모리에 들어가지 않음
  • 더 큰 Base 모델을 사용해야 함
  • 4비트 학습을 지원하는 라이브러리 환경이 준비됨

LoRA 실행 가능 여부 확인 → 메모리 부족 발생 → 배치 크기와 시퀀스 길이 축소 → Gradient Accumulation 적용 → 그래도 부족하면 QLoRA 검토

2. 배포 단계에서 Quantization 과 KV Cache를 최적화한다.

LoRA와 QLoRA는 주로 모델을 어떻게 학습할 것인지에 관한 기술, Quantization과 KV cache 최적화는 학습이 끝난 모델 어떻게 빠르게실행할 것인지에 관한 내용

Quantization

Quantization은 모델이 사용하는 숫자의 정밀도를 낮추는 방법

FP32 → FP16/BF16 → INT8 → INT4

숫자 하나를 저장하는데 필요한 비트가 줄어들면 다음 효과가 생긴다.

  • 모델 메모리 감소
  • 더 작은 GPU에서 실행 가능
  • 메모리 대역폭 사용 감소
  • 환경에 따라 추론 속도 향상
  • 동시 요청 처리량 증가 가능

FP16 모델 크기: 약 3GB INT8 모델 크기: 약 1.5GB INT4 모델 크기: 약 0.75GB

다만, 낮은 비트가 항상 빠른 것운 아님

INT4로 줄였다고 반드시 모든 환경에서 빨라지는 것은 아니다.

  • 해당 하드웨어가 INT4 연산을 잘 지원하는가?
  • 실행 엔진이 해당 양자화 형식을 지원하는가?
  • 양자화 해제 비용이 얼마나 드는가?
  • 배치 크기가 얼마인가?
  • CPU, NVIDIA GPU, Apple Silicon 중 어디서 실행하는가?

그리고 문제가 하나 더 있다.

Quantization의 정확도 손실이다.

정질도를 낮추면 일부 가중치가 손실된다. 따라서 배포 전후에 동일 질문으로 품질을 비교해야 한다.

뭐 예시로 좀 보자면

FP16 모델 사용자: 연차 신청 기한은? 답변: 사용일 3일 전까지 신청해야 합니다.

INT4 모델 사용자: 연차 신청 기한은? 답변: 사용일 전에 신청해야 합니다.

양자화 전후에 특히 확인해야 할 항목은 다음과 같다.

  • 숫자와 날짜
  • 고유 명사
  • 부정 표현
  • 전문 용어
  • 긴 답변의 일관성
  • JSON등 구조화된 출력 방식

KV Cache

언어모델은 답변을 한 번에 완성하지 않고, 토큰을 하나씩 생성한다.

"연차" "연차 신청" "연차 신청은" "연차 신청은 그룹웨어에서"

새 토큰을 만들 때마다 이전 토큰들의 Attention 계산을

TAGS#sLLM#LoRA#QLoRA#Quantization#RAG
PREVIOUSLoRA (Low-Rank Adaptation)NEXTsLLM 핵심 기술과 전체 구조
DISCUSSION

COMMENTS

GitHub 계정으로 로그인하여 댓글을 남길 수 있습니다. 댓글은 GitHub Discussions에 공개 저장되며, 작성 내용과 GitHub 프로필 정보가 다른 방문자에게 보일 수 있습니다.

GitHub 로그인 후 댓글 쓰기Discussion 열기
DOCUMENT STRUCTURE

이 문서에는 목차가 없습니다.

DOCUMENT INFO
TYPE
Markdown
DATE
2026.08.28
READ
1 min read
WORDS
0
CATEGORY
sLLM
RELATED DOCUMENTS
sLLM 핵심 기술과 전체 구조LLM 양자화와 QLoRALoRA (Low-Rank Adaptation)도메인 적응 방법Transformer에서 LoRA 적용 대상 정하기딥러닝 모델 경량화와 추론 최적화
main sLLM
1 min readUTF-8Markdown
본문 글씨 크기
RECENTLY OPENED1
제한된 자원에서 sLLM 구축하기recently opened