TECHNICAL CONCEPT · LLM TRAININGQLoRA는 4비트로 양자화한 거대 언어모델의 기본 가중치는 고정하고, 작은 LoRA 어댑터만 학습해 파인튜닝 메모리를 줄이는 방법입니다. 단순한 4비트 추론과 무엇이 다르고, NF4·double quantization·paged optimizer가 왜 필요한지 설명합니다.한 줄 정의QLoRA = 동결된 4비트 base model을 통과해 gradient를 계산하되, 업데이트는 저랭크 LoRA adapter에만 저장하는 파인튜닝 방식입니다.목차등장 이유전체 구조세 가지 핵심 기술학습 흐름LoRA·양자화와 차이오해와 FAQ1. QLoRA가 등장한 이유전체 파인튜닝은 base model의 모든 가중치뿐 아니라 gradient와 optimizer sta..