GLM-5.2 완전 정리: 1M 컨텍스트 오픈소스 코딩 모델, GPT-5.5 넘었다

코딩 에이전트 판도를 바꿀 오픈소스 모델이 나왔다

AI 코딩 에이전트를 쓰다 보면 이런 순간이 옵니다. 프로젝트 전체 코드베이스를 컨텍스트에 넣어야 하는데 토큰 한계에 걸리고, 긴 작업을 시키면 중간에 맥락을 잃어버리죠. 클로드(Claude)나 GPT 같은 폐쇄형 모델은 성능이 좋지만 가격이 부담스럽고, 오픈소스 모델은 “비슷한 수준”에서 멈추는 경우가 많았습니다.

2026년 6월 16일, 중국의 Z.ai(구 지푸 AI, Zhipu AI)가 공개한 GLM-5.2는 이 공식을 정면으로 깨뜨립니다. 100만 토큰 컨텍스트, MIT 라이선스 완전 오픈소스, 그리고 코딩 벤치마크에서 GPT-5.5를 넘어서는 수치까지. 출시 직후 Z.ai 주가가 하루에 48% 폭등한 이유를 하나씩 살펴보겠습니다.

GLM-5.2 핵심 스펙 요약 - 1M 컨텍스트, IndexShare, MIT 라이선스, 오픈소스 SOTA
GLM-5.2 핵심 스펙 요약 (출처: 직접 제작)

GLM-5.2 핵심 업그레이드 3가지

1. 진짜 쓸 수 있는 100만 토큰 컨텍스트

GLM-5.2의 가장 큰 변화는 컨텍스트 윈도우가 200K → 1M 토큰으로 5배 확장된 것입니다. 그런데 단순히 “많이 넣을 수 있다”가 아니라, 긴 코딩 에이전트 작업에서도 품질이 무너지지 않는다는 점이 핵심입니다.

Z.ai는 1M 컨텍스트 환경에서 대규모 코드 구현, 자동 리서치, 성능 최적화, 복잡한 디버깅 시나리오를 대대적으로 훈련에 포함시켰습니다. 그 결과 FrontierSWE(수시간~수십 시간 규모 엔지니어링 프로젝트 평가)에서 74.4점을 기록하며 Opus 4.7(63.4)을 11점 차이로, GPT-5.5(72.6)를 1점 차이로 앞섰습니다.

2. IndexShare — 1M 컨텍스트를 실용화한 아키텍처 혁신

100만 토큰을 처리하려면 연산 비용이 기하급수적으로 늘어납니다. GLM-5.2는 IndexShare라는 새로운 희소 어텐션(sparse attention) 기법을 도입해 이 문제를 해결했습니다.

원리는 간단합니다. 4개의 트랜스포머 레이어마다 하나의 경량 인덱서를 공유하고, 첫 번째 레이어에서 계산한 topk 인덱스를 나머지 3개 레이어가 재사용합니다. 이 구조로 토큰당 FLOPs를 2.9배 절감했고, 추론 속도 개선을 위한 MTP(Multi-Token Prediction) 레이어의 수용 길이도 최대 20% 향상됐습니다.

3. 노력 수준(Effort Level) 제어 — 속도와 성능을 직접 조절

GLM-5.2는 작업 성격에 따라 추론 깊이를 High와 Max 두 단계로 조절할 수 있습니다. 간단한 코드 수정은 빠르게, 복잡한 아키텍처 설계는 깊게 생각하는 방식이죠. 같은 토큰 예산에서 GLM-5.1보다 훨씬 높은 에이전트 코딩 성능을 보여주며, Max 모드에서는 Opus 4.8에 근접하는 성능까지 끌어올릴 수 있습니다.

숫자로 보는 GLM-5.2 성능

공식 벤치마크에서 가장 눈에 띄는 수치를 정리했습니다.

벤치마크 GLM-5.2 GLM-5.1 GPT-5.5 Opus 4.8
Terminal-Bench 2.1 (코딩 에이전트) 81.0 63.5 84.0 85.0
SWE-bench Pro (실제 이슈 해결) 62.1 58.4 58.6 69.2
FrontierSWE (대형 프로젝트) 74.4 30.5 72.6 75.1
PostTrainBench (모델 개선 능력) 34.3 20.1 28.4 37.2
HLE w/ Tools (도구 활용 추론) 54.7 52.3 52.2 57.9
AIME 2026 (수학 경시) 99.2 95.3 98.3 95.7

특히 Terminal-Bench 2.1에서 63.5 → 81.0으로 전 세대 대비 17.5점 점프는, 오픈소스 모델 역사상 보기 드문 세대 간 도약입니다. SWE-bench Pro에서는 GPT-5.5(58.6)를 처음으로 추월했고, 수학 경시 AIME 2026에서는 99.2점으로 전체 1위를 차지했습니다.

실무 관점: 가격, 접근 방법, 적용 포인트

API 및 구독 가격

GLM Coding Plan 구독 기준으로 다음과 같이 제공됩니다.

  • Lite: 월 $12.60 (연 $151.20, 2년 차부터) — 소형 저장소용
  • Pro: 월 $50.40 — Lite의 5배 사용량, 중형 저장소
  • Max: 월 $112 — Lite의 20배 사용량 + 피크 시간 전용 리소스

GLM-5.2는 피크 시간(매일 14:00~18:00, UTC+8)에 3배, 비피크에 2배 쿼터를 소모합니다. 단, 9월 말까지 비피크 사용은 1배로 프로모션 중입니다. Anthropic Claude Code 대비 최대 1/10 수준이라는 점이 Z.ai의 핵심 소구 포인트입니다.

로컬 배포도 가능

MIT 라이선스로 HuggingFace와 ModelScope에서 모델 가중치를 자유롭게 다운로드할 수 있습니다. 지원 추론 프레임워크는 vLLM, SGLang, Transformers, KTransformers, Unsloth이며, 화웨이 Ascend NPU 환경도 지원합니다. 지역 제한이나 기술적 접근 장벽이 전혀 없는 “Pure Open” 정책입니다.

이런 분께 특히 추천합니다

  • 대규모 코드베이스를 다루는 개발팀: 1M 컨텍스트로 프로젝트 전체를 한 번에 분석
  • 장시간 자율 코딩 에이전트를 운영하는 경우: FrontierSWE·SWE-Marathon 성능 검증
  • AI API 비용을 줄이고 싶은 스타트업: Claude Code 대비 1/10 가격 + 오픈소스 로컬 배포
  • 중국발 수출 통제 리스크를 헤징하려는 기업: MIT 라이선스로 지정학 리스크 회피

GLM-5.2 실무 도입 체크리스트

도입 전에 아래 항목을 점검해 보세요.

  • ✅ 사용 중인 코딩 에이전트(ZCode, Claude Code, OpenCode 등)에서 모델명을 GLM-5.2 또는 GLM-5.2[1m]으로 변경 가능한지 확인
  • ✅ 1M 컨텍스트가 필요한 작업(대형 리포지토리 분석, 장시간 태스크)과 짧은 작업(단일 함수 수정)을 구분해 Effort Level(High/Max) 설정
  • ✅ 로컬 배포 시 vLLM v0.23.0+ 또는 SGLang v0.5.13.post1+ 버전 확인
  • ✅ 피크 시간(14:00~18:00 UTC+8) 쿼터 3배 소모를 고려한 사용 스케줄링
  • ✅ 9월 말까지 비피크 1배 프로모션 기간 활용 계획 수립
  • ✅ 기존 Claude/GPT 대비 SWE-bench Pro, Terminal-Bench 실제 체감 테스트

자주 묻는 질문 (FAQ)

Q. GLM-5.2는 이전 버전(GLM-5, GLM-5.1)과 무엇이 가장 다른가요?

컨텍스트가 200K → 1M으로 5배 확장됐고, IndexShare 아키텍처로 토큰당 연산량을 2.9배 줄였습니다. 코딩 벤치마크 Terminal-Bench 2.1에서 63.5 → 81.0으로 세대 간 점프를 보였으며, Effort Level 제어로 속도-성능 균형을 직접 조절할 수 있습니다.

Q. 오픈소스 라이선스에 제한이 있나요?

없습니다. MIT 라이선스로 지역 제한, 상업적 사용 제한, 기술적 접근 장벽이 전혀 없습니다. HuggingFace·ModelScope에서 가중치를 자유롭게 다운로드해 로컬에 배포하거나 파생 모델을 만들 수 있습니다.

Q. Claude Code나 Codex 대신 GLM-5.2를 써도 될까요?

Terminal-Bench 2.1 기준 GLM-5.2(81.0)는 Claude Opus 4.8(85.0)과 4점 차이까지 따라붙었습니다. SWE-bench Pro에서는 GPT-5.5(58.6)를 62.1로 추월했습니다. 다만 Opus 4.8이 여전히 NL2Repo(69.7 vs 48.9) 등에서 앞서는 항목도 있으므로, 실제 프로젝트에서 체감 테스트 후 전환을 권장합니다.

Q. 한국에서 API 접근에 문제는 없나요?

Z.ai API 플랫폼에서 정상 접속 가능하며, GLM Coding Plan 구독도 한국에서 가능합니다. 다만 Z.ai는 2025년 1월 미국 상무부 Entity List에 등재된 이력이 있으므로, 미국 고객 대상 서비스 제공 시 컴플라이언스 확인이 필요합니다.

함께 읽으면 좋은 글

마무리: 오픈소스 코딩 모델의 새 기준점

GLM-5.2는 “오픈소스는 폐쇄형 모델의 하위 호환”이라는 통념을 사실상 무너뜨렸습니다. 1M 컨텍스트가 실제 코딩 에이전트 작업에서 안정적으로 작동하고, GPT-5.5를 SWE-bench Pro에서 추월했으며, MIT 라이선스로 누구나 자유롭게 쓸 수 있습니다. 출시 당일 주가 48% 급등, HuggingFace 월 54만 회 다운로드는 시장의 즉각적 반응을 보여줍니다.

지금 Claude Code나 Codex를 쓰고 계시다면, GLM-5.2로 테스트 프로젝트를 하나 돌려보시는 걸 권합니다. 특히 대규모 리포지토리나 장시간 자율 태스크에서 체감 차이가 클 것입니다.

Z.ai에서 GLM-5.2 무료로 체험해 보기

HuggingFace에서 GLM-5.2 모델 다운로드