GLM-5.3, 오픈 웨이트로 공개
GLM-5.2와 같은 베이스 모델에 사후 학습만 적용해 복잡한 코딩과 장기 작업 성능을 높임
자체 Z.ai Code Bench에서 GLM-5.2보다 50% 향상됐으며, 코딩용 오픈 웨이트 모델 가운데 가장 강력한 성능을 보임
Terminal Bench 3.0과 Agents' Last Exam 등 공개 벤치마크에서도 오픈소스 SOTA를 달성함
사후 학습 규모를 키우는 과정에서 예상보다 빠르게 사이버 역량이 발달함
취약점 발견을 측정하는 CyberGym에서 84.5점으로 SOTA를 기록함
공격 체인의 후반으로 갈수록 향상 폭이 커져, 익스플로잇 벤치마크에서는 GLM-5.2 성능의 2배를 넘김
벤치마크
Benchmark | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | -- | -- | 21.1 | 33.7 | 34.6 |
DeepSWE (v1.1) | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | -- | -- |
ProgramBench (Almost Solved) | 19.0 | 9.5 | 17.5 | -- | 10.5 | 15.5 | 33.0 | 23.0 |
FrontierSWE | 78.1 | 67.5 | -- | -- | -- | 66.5 | 88.2 | -- |
SWE-Marathon (v1.1) | 42.5 | 19.4 | 48.1 | -- | -- | 48.8 | 33.1 | 42.5 |
PostTrainBench | 39.8 | 31.7 | 32.0 | -- | -- | 32.9 | 41.8 | 36.2 |
CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
ExploitGym (2h / 6h) | 105 / 130 | 29 / 39 | 36 / 70 | -- | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
ExploitBench | 54.4 | 24.4 | 32.2 | -- | 28.8 | 40.0 | 78.0 | 76.5 |
Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
AutomationBench (v1.0.6) | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
로컬 배포
여러 추론 프레임워크로 GLM-5.3을 배포할 수 있음
로컬 사양
Quantization | 모델 크기 | 최소 RAM | 권장 RAM | 예상 생성 속도* |
|---|---|---|---|---|
UD-IQ1_S | 217 GB | 256 GB | 288~320 GB | ~12–16 tok/s |
UD-IQ1_M | 228 GB | 256 GB | 288~320 GB | ~12–15 tok/s |
UD-IQ2_M | 239 GB | 256 GB | 288~320 GB | ~11–14 tok/s |
UD-Q2_K_XL | 254 GB | 288 GB | 320~384 GB | ~11–14 tok/s |
UD-IQ3_XXS | 282 GB | 320 GB | 384 GB | ~9–12 tok/s |
UD-Q3_K_XL | 343 GB | 384 GB | 448~512 GB | ~10 tok/s |
UD-IQ4_XS | 365 GB | 384 GB | 448~512 GB | ~8–10 tok/s |
UD-Q4_K_XL | 467 GB | 512 GB | 576~640 GB | ~6–8 tok/s |
UD-Q5_K_XL | 562 GB | 640 GB | 768 GB | ~5–7 tok/s |
UD-Q6_K_XL | 684 GB | 768 GB | 896 GB~1 TB | ~4–6 tok/s |
Q8_0 | 801 GB | 896 GB | 1 TB+ | ~3–5 tok/s |
BF16 | 1.51 TB | 1.6 TB+ | 2 TB+ | ~1–3 tok/s |
로컬 추천
보유 RAM | Quant | 예상 속도 |
|---|---|---|
256 GB | IQ1_S / IQ1_M | ~12–16 tok/s |
384 GB | Q2_K_XL / IQ3_XXS | ~9–14 tok/s |
512 GB | Q3_K_XL / IQ4_XS | ~8–10 tok/s |
640 GB | Q4_K_XL | ~6–8 tok/s |
768 GB | Q5_K_XL | ~5–7 tok/s |
1 TB | Q6_K_XL / Q8_0 | ~3–6 tok/s |
source https://huggingface.co/zai-org/GLM-5.3
HN에서는 GLM-5.3 계열이 오픈 웨이트 모델의 실용성을 크게 높였다는 기대가 두드러졌다. 어려운 코딩 과제를 풀고 장시간 작업을 계획하는 능력이 기존 플래시 모델보다 낫다는 경험이 나왔다. 다만 이런 호평 중 상당수는 정식 5.3이 아니라 5.3 Flash를 대상으로 한다. 모델과 작업 환경을 밝히지 않은 단순 비교만으로 성능을 판단하기 어렵다는 지적도 뒤따랐다.
실무에서 중요한 기준은 최고 점수보다 비용과 응답 속도였다. 같은 작업도 공급자와 추론 설정, 캐시 적중률에 따라 비용과 지연 시간이 크게 달라졌다. DeepSeek보다 빠르고 저렴했다는 사례가 있는 반면, 몇 배의 비용을 내고도 느렸다는 경험도 있었다. 구현에는 충분하지만 기획이나 글쓰기에서는 추론 품질과 답변 습관이 아쉽다는 평가도 있어, 전면 교체에 앞서 업무별 검증이 필요하다.
로컬 구동은 데이터와 실행 환경을 직접 관리할 수 있다는 점에서 관심을 끌었다. 그러나 512GB급 메모리 장비에 큰돈을 들이는 선택은 별개 문제다. 모델 크기와 API 가격이 빠르게 낮아지는 만큼 순수한 토큰 비용만 보면 구독이나 클라우드가 유리할 수 있다. 반대로 속도가 덜 중요한 야간 일괄 작업에는 저렴한 중고 서버도 쓸 만하다는 경험이 나왔다. 기업이라면 원하는 데이터 처리 정책과 배포 경로를 확보할 수 있는지도 따져야 한다.
사이버 보안 능력 공개를 두고는 악용 가능성을 걱정하는 시각과 취약점 탐지·방어 자동화에 써야 한다는 주장이 맞섰다. 결국 도입 여부는 벤치마크 순위만으로 정하기 어렵다. 계획과 구현을 나눠 시험하고, 총토큰과 캐시, 지연 시간, 개인정보 조건, 비전 같은 필수 기능을 동일한 업무로 비교해야 한다. 오픈 웨이트의 장점도 이런 운영 조건을 충족할 때 실질적인 가치가 된다.
