GLM-5.3-Flash 무료 스텔스 모델의 정체: 플래그십 지능을 1/10 가격에

글 쓴 사람

서상덕 (Apptics 에디터) — 이 글은 Z.ai 공식 문서·블로그, OpenRouter·Artificial Analysis 공개 데이터를 직접 확인하고 정리한 모델 분석 기사입니다. 별도 실사용 테스트는 포함되지 않았습니다.

무료로 풀린 정체불명 모델, 정체가 드러났다

지난주 개발자 커뮤니티에서는 ‘ox-alpha’라는 이름의 모델이 화제였습니다. 만든 회사도 공개되지 않은 이 모델이 OpenRouter와 OpenCode에서 무료 공개 직후 ‘이번 주 가장 많이 쓰인 모델’ 1위에 올랐기 때문입니다. 그리고 8월 26일, Z.ai(구 지푸AI)가 답을 내놨습니다. 그 스텔스 모델의 정식 이름은 GLM-5.3-Flash였습니다.

더 흥미로운 건 숫자입니다. 플래그십 모델의 지능을 갖추면서 가격은 기존 플래그십의 10분의 1 수준. “좋은 모델은 비싸다”는 상식이 깨지는 순간입니다. 이 글에서 무엇이 달라졌고, 실제로 쓸 만한지 정리했습니다.

GLM-5.3-Flash, 스펙 한눈에 보기

GLM-5.3-Flash는 GLM-5 시리즈의 첫 네이티브 멀티모달 모델입니다. 텍스트만 다루던 이전 모델과 달리 이미지·영상·파일까지 기본 입력으로 받습니다.

항목 내용
파라미터 총 3,200억 / 활성 180억 (MoE)
컨텍스트 1M 토큰
입력 모드 텍스트 + 이미지 + 영상 + 파일 (네이티브)
추론 모드 항상 켜짐 (low / high / max)
가격 (1M 토큰) 입력 $0.075 / 출력 $0.25 (출시 기념 50% 할인)
라이선스 MIT, 오픈 웨이트 (Hugging Face 공개)
출시일 2026년 8월 26일

흥미로운 비교 포인트가 하나 있습니다. 전 세대인 GLM-4.5(총 3,550억 파라미터)와 총 파라미터는 비슷한데, 활성 파라미터는 180억으로 절반 수준, 레이어 수는 92개에서 45개로 반토막입니다. 처음부터 ‘저비용 추론’을 목표로 설계된 모델이라는 뜻입니다.

가격이 10분의 1이 된 이유: 희소+선형 어텐션 하이브리드

GLM-5.3-Flash 희소 선형 어텐션 하이브리드 아키텍처 개념도 (GLM-5.3-Flash 라벨)

비용 절감의 핵심은 아키텍처입니다. GLM-5.3-Flash는 오픈소스 프런티어 모델 최초로 희소 어텐션(sparse attention)과 선형 어텐션(linear attention)을 결합한 하이브리드 구조를 채택했습니다.

  • 선형 어텐션이 지역 의존성을 상태 모델링으로 저렴하게 처리하고
  • 희소 어텐션이 가벼운 인덱서로 전역 컨텍스트에서 필요한 부분만 골라 읽습니다
  • IndexPool 기법으로 1M 토큰 환경에서 인덱서 키 벡터 4개를 1개로 압축해 지연과 메모리를 추가로 줄였습니다

그 결과 플래그십 GLM-5.3과 비교해 어텐션 연산량은 3.01배, KV 캐시 크기는 4.44배 줄었습니다. 여기에 30조 토큰 규모의 멀티모달 사전학습 데이터와 Manifold-Constrained Hyper-Connections(mHC) 설계가 더해져 “더 적은 연산으로 더 높은 지능”을 달성했다는 게 Z.ai의 설명입니다.

벤치마크: 플래그십급 성능을 플래시 가격에

핵심 수치를 표로 정리하면 이렇습니다.

벤치마크 GLM-5.3-Flash 비교
DeepSWE v1.1 (코딩) 63.4 GLM-5.2: 46.2
AutomationBench (에이전트) 48.8 GLM-5.2: 26.2
Z.ai Code Bench (max) 29.0 Claude Opus 4.8: 29.5
AA Intelligence Index v4.1.1 57 태스크당 비용 $0.045 (할인가)

코딩·에이전트 6개 벤치마크에서 GLM-5.2를 전 항목 앞섰고, 자체 코딩 벤치마크에서는 최고 추론 설정 시 Claude Opus 4.8(29.5)에 0.5점 차까지 따라붙었습니다. Artificial Analysis 지능 지수에서는 57점 — 참고로 플래그십 GLM-5.3은 60점입니다. 지능은 플래그십의 95% 수준인데 비용은 10분의 1이니, 가성비 곡선(파레토 프런티어) 자체를 새로 그었다는 평가를 받습니다.

Artificial Analysis에서 직접 확인하기

코딩 밖으로: 화면을 보고 스스로 고치는 멀티모달 에이전트

이번 모델의 진짜 차별점은 네이티브 멀티모달입니다. 시각 능력이 코딩 루프 안에 통합돼 있어, 모델이 직접 화면·렌더링 결과·인터랙션을 확인하고 자신이 만든 결과물을 검사한 뒤 수정합니다.

  • 프런트엔드·게임 개발: 코드를 짜고, 렌더링된 화면을 보고, 스스로 디버깅
  • Blender 3D 장면 구성, 브라우저(BUA)·컴퓨터(CUA) 조작까지 연계
  • 코딩 외 업무: 문서·스프레드시트·대시보드 해석, 리서치부터 PPTX·PDF·DOCX·XLSX 파일 납품까지 엔드투엔드 워크플로 수행

“이미지를 보여주고 설명해 달라”는 수준이 아니라, 결과물을 눈으로 검증하며 일하는 에이전트에 가깝습니다.

지금 바로 쓰는 법: API·코딩 플랜·자체 배포

활용 경로는 크게 세 가지입니다.

① API 호출 — 모델 코드는 glm-5.3-flash. OpenAI·Anthropic 호환 프로토콜을 모두 지원해 기존 코드의 모델명만 바꾸면 됩니다. 공식 권장 설정은 temperature 1, top_p 0.95, reasoning_effort max입니다.

② GLM Coding Plan — Claude Code, Codex, ZCode 등 20여 개 코딩 에이전트에서 구독형으로 사용 가능하며, 플래그십 GLM-5.3 대비 3배의 쿼터가 주어집니다. 주말·비피크 시간대에는 포인트 소모가 50%로 줄어듭니다.

③ 자체 배포 — MIT 라이선스로 웨이트가 공개돼 있어 상업적 제약이 없습니다. SGLang, vLLM, TokenSpeed로 로컬·사내 서버에 직접 올릴 수 있습니다.

GLM-5.3-Flash 공식 문서 바로가기
GLM Coding Plan 구독 페이지

가격 정리: 얼마나 저렴한가

모델 입력 ($/1M) 출력 ($/1M) 캐시 입력 ($/1M)
GLM-5.3-Flash (할인) $0.075 $0.25 $0.015
GLM-5.3 / 5.2 $1.4 $4.4 $0.26
GLM-4.7-FlashX $0.07 $0.4 $0.01

플래그십 대비 입력가는 약 19분의 1, 출력가는 약 18분의 1입니다. 다만 현재 표기된 가격은 출시 기념 50% 할인가(정가 $0.15/$0.50)라는 점은 염두에 둬야 합니다. 할인이 끝나도 플래그십 대비 압도적 격차는 유지됩니다.

Z.ai 전체 모델 가격표 확인

에디터가 직접 확인한 점

  • 벤치마크 해석은 주의: Flash와 타사 모델 비교는 평가 도구(하네스)·컨텍스트 설정이 서로 다르므로 절대 우열보다는 “같은 가격대 대비” 관점으로 보는 것이 안전합니다. 이는 Z.ai 공식 블로그가 직접 밝힌 유의사항입니다.
  • ox-alpha 검증 방식이 영리합니다: 정체를 숨기고 실사용 트래픽으로 먼저 검증한 뒤 공개한 전략으로, 발표 당일 “이미 써봤다”는 개발자 반응을 확보했습니다.
  • 중국산 AI 칩으로 서비스 중이라는 점도 공식 확인됩니다. SGLang 기반 자체 추론 엔진으로 엔드투엔드 서빙 성능을 3배 끌어올렸고, 토큰당 비용이 엔비디아 GPU 수준이라고 밝혔습니다. 하드웨어 제재 환경에서 나온 성과라 업계 의미가 큽니다.
  • MIT 라이선스 + 오픈 웨이트 조합은 자체 배포를 검토하는 기업에게 가장 큰 장점입니다. 다만 데이터 보안이 민감한 환경이라면 중국 리전에 대한 내부 정책 검토는 별도입니다.

실무 도입 체크리스트

  • [ ] 반복적 코딩·리팩토링 작업에 플래그십 대신 Flash를 기본 모델로 지정해 비용 절감 효과를 측정했는가
  • [ ] 스크린샷·디자인 시안을 입력으로 주는 시각 기반 작업에 네이티브 멀티모달을 활용해 봤는가
  • [ ] GLM Coding Plan 구독 시 3배 쿼터·비피크 50% 할인 조건을 팀 워크로드와 비교했는가
  • [ ] 자체 배포가 필요하면 SGLang/vLLM 호환성과 MIT 라이선스 조건을 검토했는가
  • [ ] 현재 가격이 기간 한정 할인임을 감안해 정상가 기준 예산 시뮬레이션까지 마쳤는가

자주 묻는 질문 (FAQ)

Q1. GLM-5.3과 뭐가 다른가요?
같은 시리즈지만 성격이 다릅니다. GLM-5.3은 텍스트 전용 플래그십(코딩·보안 특화)이고, GLM-5.3-Flash는 네이티브 멀티모달에 초저비용 아키텍처를 적용한 모델입니다. 지능은 플래그십의 약 95% 수준이면서 가격은 10분의 1 수준입니다.

Q2. 무료로 쓸 수 있나요?
API는 유료지만 출시 기념 50% 할인 중이고, 이전에 진행한 ox-alpha 익명 테스트 기간에는 무료로 풀렸습니다. 시리즈 중 GLM-4.7-Flash 같은 완전 무료 모델도 별도로 존재합니다.

Q3. ox-alpha가 바로 이 모델인가요?
맞습니다. 출시 전 OpenCode·OpenRouter에 익명으로 올린 모델이 ox-alpha였으며, 해당 주간 가장 인기 있는 모델 1위를 기록한 뒤 정체가 공개됐습니다.

Q4. 한국어 성능은 어떤가요?
공식 문서에 한국어 특화 수치는 별도로 공개되지 않았습니다. 다만 30조 토큰 멀티모달 코퍼스 학습과 이전 세대들의 한국어 지원 이력을 고려하면 기본 지원은 예상됩니다.

결론: “비싼 모델 = 좋은 모델” 공식의 균열

GLM-5.3-Flash의 진짜 메시지는 분명합니다. 아키텍처 혁신으로 플래그십 지능을 플래시 가격에 제공할 수 있다는 것. 희소+선형 어텐션 하이브리드, 180억 활성 파라미터, 중국산 칩에서의 대규모 서빙까지 — 비용 구조 자체를 바꾼 설계의 결과물입니다. 코딩 에이전트 비용이 부담이었던 개발자라면, 그리고 멀티모달 워크플로를 저렴하게 자동화하고 싶은 팀이라면 지금 테스트해 볼 가치가 충분합니다. 아래 링크에서 공식 문서를 확인하고 직접 호출해 보세요.

GLM-5.3-Flash 공식 발표 블로그

함께 읽으면 좋은 글