Unsloth GLM-5.2 – 로컬에서 실행하는 방법
사용 가이드
2-bit dynamic quant UD-IQ2_M은 디스크 공간 239GB를 사용합니다.
이 크기는 256GB unified memory Mac에 바로 들어가며,
MoE offloading을 사용하면 1x24GB GPU와 256GB RAM 환경에서도 잘 동작합니다.
1-bit quant는 223GB RAM에 들어가고, 8-bit는 810GB RAM이 필요합니다.
표: inference 하드웨어 요구사항 (단위 = 총 메모리: RAM + VRAM 또는 unified memory)
1-bit | 2-bit | 3-bit | 4-bit | 5-bit | 8-bit |
|---|---|---|---|---|---|
223 GB | 245 GB | 290-360 GB | 372-475 GB | 570 GB | 810 GB |
최적의 성능을 내려면 VRAM과 system RAM을 포함한 전체 사용 가능 메모리가 quantized model file size보다 충분히 커야 합니다.
권장 설정
GLM-5.2에는 3가지 thinking mode가 있습니다. Non-thinking, 그리고 High + Max 두 단계의 Thinking입니다. 복잡한 작업에는 Max Thinking을 사용하세요. Unsloth Studio에서는 UI로 High + Max Thinking과 non-Thinking을 쉽게 전환할 수 있습니다.
대부분의 use case에는 다음 설정을 사용하세요.
Default Settings (Most Tasks) | SWE-Bench Pro |
|---|---|
|
|
|
|
Maximum context window:
1,048,576.
GLM 5.2는 기본적으로 thinking mode를 사용합니다. reasoning_effort는 "high", "max", 또는 disabled thinking을 지원합니다. thinking을 끄려면 --chat-template-kwargs '{"enable_thinking":false}'를 사용하세요.
Windows PowerShell에서는 --chat-template-kwargs "{\"enable_thinking\":false}"를 사용하세요.
true와 false는 서로 바꿔 사용할 수 있습니다.
이제 llama.cpp에서도 --reasoning on 또는 --reasoning off를 사용할 수 있습니다!
📈 Quantization 분석
GLM-5.2-GGUF quantization의 정확도를 가늠하기 위해 KLD(KL Divergence)도 실행했습니다. 전반적으로 dynamic 4-bit UD-Q4_K_XL과 dynamic 5-bit UD-Q5_K_XL은 대체로 lossless에 가깝고, 더 작은 quant도 훌륭하게 동작합니다.
순수 top-1% accuracy 기준으로 보면 dynamic 1-bit는 86% 더 작으면서도 약 76.2% accuracy를 냅니다. Dynamic 2-bit는 84% 더 작으면서도 약 82% accuracy를 냅니다. 이는 일부 layer를 더 높은 precision으로 동적 quantization한다고 해서 모델이 86% 작아진 만큼 86% 나빠지는 것이 아니라, 전체 1.5TB 모델보다 능력이 24% 낮아지는 정도라는 점을 보여줍니다.
그렇다면 “76% accuracy”는 실제로 무엇을 뜻할까요?
76% top-1%는 The capital of France is라는 입력에서 76%는 Paris를 고르고 24%는 Sydney를 고른다는 뜻이 아닙니다. 이 예시는 100% Paris이고 0% Sydney입니다.
76%에는 전체 corpus에 걸친 filler words와 stop words도 포함됩니다. 예를 들면 다음과 같습니다.
"Create a novel"
I will now create a novel...
The novel is below:
What genre would you like it to be?
각 예시는 모두 맞지만, 바뀌는 것은 [I, The, What]입니다. baseline은 [I]를 100% 사용할 수 있지만, 이제는 [I]가 76%, [The]가 24%가 되는 식입니다.
이 말은 출력의 24%가 gibberish가 되거나 잘못된 답이 나온다는 뜻이 아닙니다.

99.9% KLD도 일반적으로 좋습니다. 다만 4bit부터는 개선 폭이 더 커지므로, distribution을 크게 벗어난 massive task에는 dynamic 4-bit가 아마 가장 적합합니다.

mean KLD는 대체로 disk space와 함께 명확한 monotonic trend를 보이며, 1-bit에서도 GLM 5.2가 잘 동작한다는 점을 보여줍니다.

GLM-5.2 실행 튜토리얼
이제 llama.cpp와 Unsloth Studio에서 GLM-5.2를 실행할 수 있습니다. 접근성과 정확도 면에서 가장 좋은 결과를 내기 위해 239GB UD-IQ2_M quant를 사용하겠습니다.
Unsloth Studio에서 GLM-5.2 실행하기
GLM-5.2는 로컬 AI용 오픈소스 web UI인 Unsloth Studio에서 실행할 수 있습니다. Unsloth Studio는 자동으로 RAM offload를 수행하고 multiGPU setup을 감지합니다. Unsloth Studio를 사용하면 MacOS, Windows, Linux에서 모델을 로컬로 실행할 수 있으며, 다음 기능을 제공합니다.
GGUF와 safetensor model 검색, 다운로드, 실행
Self-healing tool calling + web search
Code execution(Python, Bash)
Automatic inference parameter tuning(temp, top-p 등)
llama.cpp를 통한 빠른 CPU + GPU inference
70% 적은 VRAM으로 LLM training 2배 빠르게 실행

Unsloth 설치 및 실행
설치하려면 terminal에서 다음을 실행하세요.
MacOS, Linux, WSL:
curl -fsSL https://unsloth.ai/install.sh | shWindows PowerShell:
irm https://unsloth.ai/install.ps1 | iexUnsloth 실행
MacOS, Linux, WSL, Windows:
unsloth studio -H 0.0.0.0 -p 8888그런 다음 browser에서 http://127.0.0.1:8888 또는 각자 표시된 URL을 여세요.
HTTPS와 Cloudflare로 Unsloth를 안전하게 실행하기
NEW! Unsloth는 이제 무료 Cloudflare tunnel을 통해 Studio를 HTTPS로 안전하게 실행하는 방법을 제공합니다. 아래 명령을 사용하세요. Windows, Mac, Linux에서 동작합니다.
unsloth studio --secureGLM-5.2 검색 및 다운로드
Unsloth Studio는 자동으로 RAM offload를 수행하고 multiGPU setup을 감지합니다. 처음 실행할 때는 계정을 보호하기 위해 password를 만들고, 이후 다시 sign in해야 합니다.
그다음 Studio Chat tab으로 이동해 search bar에서 GLM-5.2를 검색하고 원하는 model과 quant를 다운로드하세요. 모델을 실행할 compute가 충분한지 확인해야 합니다.

GLM-5.2 실행
Unsloth Studio를 사용할 때 inference parameter는 자동 설정됩니다. 그래도 원한다면 직접 변경할 수 있습니다. context length, chat template, 기타 설정도 편집할 수 있습니다.
자세한 내용은 Unsloth Studio inference guide를 참고하세요.

2-bit GLM-5.2가 tool-calling과 SVG gen으로 실행되는 예시입니다.
llama.cpp에서 GLM-5.2 실행하기
이 가이드에서는 최소 245GB RAM이 필요한 UD-IQ2_M quant를 실행합니다. quantization type은 자유롭게 바꿔도 됩니다. 이 튜토리얼에서는 빠른 local inference를 위해 llama.cpp를 사용합니다. GGUF: GLM-5.2-GGUF
GitHub에서 최신
llama.cpp를 받으세요. 아래 build instruction을 따라도 됩니다. GPU가 없거나 CPU inference만 원한다면-DGGML_CUDA=ON을-DGGML_CUDA=OFF로 바꾸세요. Apple Mac / Metal device에서는-DGGML_CUDA=OFF로 설정한 뒤 평소처럼 진행하면 됩니다. Metal support는 기본으로 켜져 있습니다.
apt-get update
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first --target llama-cli llama-mtmd-cli llama-server llama-gguf-split
cp llama.cpp/build/bin/llama-* llama.cpp1. 이제 ollama run처럼 llama.cpp를 직접 사용해 model을 load하고 download할 수 있습니다. 먼저 UD-IQ2_M처럼 원하는 quantization type을 선택하세요. 또한 export LLAMA_CACHE="unsloth/GLM-5.2-GGUF"를 사용하면 llama.cpp가 특정 위치에 저장하도록 강제할 수 있습니다. 이 download process는 매우 느릴 수 있으므로, 다음 section의 manual download process를 사용하는 편이 좋습니다.
export LLAMA_CACHE="unsloth/GLM-5.2-GGUF"
./llama.cpp/llama-cli \
-hf unsloth/GLM-5.2-GGUF:UD-IQ2_M \
--temp 1.0 \
--top-p 0.95 \
--min-p 0.012. model을 수동으로 다운로드하고 싶다면 (훨씬 빠릅니다!), pip install huggingface_hub 설치 후 아래 code로 다운로드할 수 있습니다. 다운로드가 멈추면 Hugging Face Hub, XET debugging을 참고하세요.
hf download unsloth/GLM-5.2-GGUF \
--local-dir unsloth/GLM-5.2-GGUF \
--include "*UD-IQ2_M*" # Use "*UD-Q8_K_XL*" for near full precisionDynamic 1bit를 사용하려면 다음을 실행하세요.
hf download unsloth/GLM-5.2-GGUF \
--local-dir unsloth/GLM-5.2-GGUF \
--include "*UD-IQ1_S*"3. 그런 다음 conversation mode로 model을 실행합니다. 2bit는 unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf, 1bit는 unsloth/GLM-5.2-GGUF/UD-IQ1_S/GLM-5.2-UD-IQ1_S-00001-of-00006.gguf를 사용하세요.
./llama.cpp/llama-cli \
--model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
--temp 1.0 \
--top-p 0.95 \
--min-p 0.014. llama-cli를 실행하면 다음 화면이 표시됩니다.

그다음 짧은 Flappy Bird game을 만들라고 prompt를 입력하면 다음 결과를 얻습니다.

그리고 이 game은 sound가 있으며 훌륭하게 동작합니다. 다시 한 번 말하지만, 이것은 1-bit quantization이었고 잘 작동했습니다!

KV Cache quantization으로 long context 사용하기
llama.cpp에서 long context를 활용하려면 memory usage를 줄이기 위해 KV cache quantization을 사용해야 합니다. 최근 llama.cpp에는 KV cache quantization의 accuracy를 높이는 trick이 추가됐습니다. 관련 PR과 다른 PR을 참고하세요!
현재 지원되는 KV cache dtype은 다음과 같습니다.
f32, f16, bf16, q8_0, q4_0, q4_1, iq4_nl, q5_0, q5_1기본값은 f16입니다. weight당 약 4.5 bits인 q4_0을 사용하면 context length를 약 16 / 4.5 = 3.5배 더 길게 확장할 수 있습니다. 예를 들어 model이 기존에 10K를 지원했다면 35K까지 도달할 수 있습니다. q4_1은 shifting parameter도 얻을 수 있고 weight당 5 bits이므로, 아마 더 나은 선택입니다. 이 경우 context는 3.2배 더 길어집니다.
아래처럼 사용하세요.
./llama.cpp/llama-cli \
--model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
--temp 1.0 \
--top-p 0.95 \
--min-p 0.01 \
--cache-type-k q4_1 \
--cache-type-v q4_1Benchmarks
아래에서 GLM-5.2 benchmark를 table 형식으로 더 볼 수 있습니다.


Benchmark | GLM-5.2 | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro |
|---|---|---|---|---|---|---|---|---|
Reasoning | ||||||||
HLE | 40.5 | 49.8* | 41.4* | 45 | 31 | 41.4 | 37 | 37.7 |
HLE (w/ Tools) | 54.7 | 57.9* | 52.2* | 51.4* | 52.3 | 53.5 | - | 48.2 |
CritPt | 20.9 | 20.9 | 27.1 | 17.7 | 4.6 | 13.4 | 3.7 | 12.9 |
AIME 2026 | 99.2 | 95.7 | 98.3 | 98.2 | 95.3 | 97 | - | 94.6 |
HMMT Nov. 2025 | 94.4 | 96.5 | 96.5 | 94.8 | 94 | 95 | 84.4 | 94.4 |
HMMT Feb. 2026 | 92.5 | 96.7 | 96.7 | 87.3 | 82.6 | 97.1 | 84.4 | 95.2 |
IMOAnswerBench | 91.0 | 83.5 | - | 81 | 83.8 | 90 | - | 89.8 |
GPQA-Diamond | 91.2 | 93.6 | 93.6 | 94.3 | 86.2 | 90 | 93 | 90.1 |
Coding | ||||||||
SWE-bench Pro | 62.1 | 69.2 | 58.6 | 54.2 | 58.4 | 60.6 | 59 | 55.4 |
NL2Repo | 48.9 | 69.7 | 50.7 | 33.4 | 42.7 | 47.2 | 42.1 | 35.5 |
DeepSWE | 46.2 | 58 | 70 | 10 | 18 | 18 | 20 | 8 |
ProgramBench | 63.7 | 71.9 | 70.8 | 39.5 | 50.9 | - | - | 47.8 |
Terminal Bench 2.1 (Terminus-2) | 81.0 | 85 | 84 | 74 | 63.5 | 75 | 65 | 64 |
Terminal Bench 2.1 (Best Reported Harness) | 82.7 | 78.9 | 83.4 | 70.7 | 69 | - | - | - |
FrontierSWE (Dominance) | 74.4 | 75.1 | 72.6 | 39.6 | 30.5 | - | - | 29.0 |
PostTrainBench | 34.3 | 37.2 | 28.4 | 21.6 | 20.1 | - | - | - |
SWE-Marathon | 13.0 | 26.0 | 12.0 | 4.0 | 1.0 | - | - | - |
Agentic | ||||||||
MCP-Atlas (Public Set) | 76.8 | 77.8 | 75.3 | 69.2 | 71.8 | 76.4 | 74.2 | 73.6 |
Tool-Decathlon | 48.2 | 59.9 | 55.6 | 48.8 | 40.7 | - | - | 52.8 |
source https://unsloth.ai/docs/models/glm-5.2
HN에서는 GLM-5.2를 로컬에서 돌릴 수 있다는 사실보다, 그렇게 돌린 결과가 실제 개발 업무에 쓸 만한지가 더 큰 쟁점이었다. 256GB급 메모리나 24GB VRAM을 갖춘 장비로 진입 가능하다는 점은 흥미를 끌었지만, 많은 댓글은 “메모리에 올라간다”와 “쾌적하게 쓴다”를 구분해야 한다고 봤다. 낮은 비트 양자화와 느린 프롬프트 처리 속도를 감수하면, 개인 개발자가 기대하는 로컬 코딩 비서와는 아직 거리가 있다는 판단이다.
평가 기준은 단순한 토큰 생성 속도에 머물지 않았다. 긴 컨텍스트를 넣었을 때 프롬프트 처리가 얼마나 느려지는지, 코딩 작업에서 도구 호출이나 세부 구현 오류가 얼마나 늘어나는지가 중요하게 다뤄졌다. 문서가 4비트나 5비트 양자화를 거의 손실이 없는 수준으로 설명하더라도, 실제 장문 작업에서는 더 높은 비트 양자화가 필요하다는 경험담도 나왔다. 특히 1비트나 2비트는 저장 공간을 크게 줄이는 대신, 정확도 저하가 작은 실수로 누적될 수 있다는 우려가 컸다.
비용 계산도 사용 주체에 따라 갈렸다. 개인이 Mac Studio, Strix Halo, DGX Spark 같은 장비를 사는 경우에는 감가상각과 전력 비용까지 고려하면 Claude나 Codex 같은 구독형 서비스가 더 합리적이라는 계산이 많았다. 반면 여러 개발자가 함께 쓰는 회사라면 수만 달러 규모의 사내 LLM 서버가 API 비용 절감, 토큰 사용량 제약 완화, 데이터 통제 측면에서 검토할 만하다는 의견도 있었다.
장기적으로 로컬 모델이 프런티어 모델 업체에 압박을 줄 가능성은 인정됐다. 다만 그 전제는 메모리와 GPU 가격 하락, 더 작은 고성능 코딩 모델의 등장, 양자화 이후에도 유지되는 실사용 품질이다. 지금 확인해야 할 것은 “로컬 실행 가능”이라는 문구가 아니라, 필요한 양자화 수준에서 코딩 품질이 버티는지, 긴 컨텍스트 처리 속도가 업무 리듬을 해치지 않는지, 장비 투자비가 구독료보다 실제로 나은지다.
