前两天在 OpenRouter 上以代号 “Ox Alpha” 匿名霸榜、引发社区全网盲猜的神秘模型,终于正式“掉马”——智谱(Z.ai)正式发布原生多模态 MoE 模型 GLM-5.3-Flash。
该模型基于 MIT 协议完全开源,不仅支持 100 万(1M)上下文与图文/视频输入,还直接在代码与 Agent 评测中逼近顶尖的 Claude Opus 4.8,而成本直接砍到了前代 GLM-5.2 的十分之一。
看点 1:前几天全网在测的“Ox Alpha”究竟是谁?
- 匿名公测实测:发布前一周,智谱在海外平台以“Ox Alpha”(社区戏称“牛来”)匿名提供算力测试。
- 全流程国产算力跑通:官方证实,该模型的整个匿名早期预览均在纯国产 AI 芯片集群上完成服务调度,基于深度定制的 SGLang 引擎实现了预填充(Prefill)与解码(Decode)解耦,端到端吞吐提升了 3 倍。
看点 2:极致的“偷感”架构——320B 体量,单 Token 仅激活 18B
GLM-5.3-Flash 在 30T 多模态语料上从零预训练,核心优化全点在“省显存”和“提效率”上:
- 混合注意力机制:交替组合 KDA 线性注意力(处理局部细节)与 NoPE 稀疏 MLA(全局检索),单 Token 仅路由到 288 个专家中的 8 个。
- IndexPool 键向量压缩:把 4 个索引 Key 向量加权压缩为 1 个,让注意力计算量锐减 3 倍,1M 超长上下文下的 KV Cache 显存暴降 4.4 倍。
- 流形约束超连接(mHC):在总参数接近 320B 的情况下,激活参数与网络层数相比 GLM-4.5 减半,实现了“小马拉大车”的高并发响应。
看点 3:打到“地板价”的国内调用成本
折算为人民币后,其 API 价格极具攻击力:
| 计费项 | 美元定价 | 折合人民币(约) |
|---|---|---|
| 标准输入(Prompt) | $0.15 / 百万 Token | ≈ 1.08 元 / 百万 Token |
| 命中缓存输入(Cache Hit) | $0.03 / 百万 Token | ≈ 0.22 元 / 百万 Token |
| 输出(Output) | $0.50 / 百万 Token | ≈ 3.60 元 / 百万 Token |
开发成本体感:在 Artificial Analysis 的自动化基准评测中,执行单次完整长链任务的综合花费仅需 约 0.3 元人民币($0.045);GLM 编程订阅用户(Coding Plan)的可用额度直接扩充至以往旗舰的 3 倍。
看点 4:逼近 Opus 4.8,但它也有短板
| 评测维度 | GLM-5.3-Flash | 参考标杆 | 核心结论 |
|---|---|---|---|
| Terminal-Bench 2.1 | 84.3 | Opus 4.8: 85.0 | 终端命令与脚本执行已处第一梯队 |
| DeepSWE v1.1 | 63.4 | GLM-5.2: 46.2 | 代码工程能力大幅跃升 |
| AutomationBench | 48.8 | GLM-5.2: 26.2 | 复杂长程工作流执行翻倍提升 |
| OfficeQA Pro | 62.4 | 超越 Opus 4.8 | 免 OCR 直接分析 PDF/表格/PPT 优势明显 |
- 优势场景:跨文件 Repo 级重构、长达百万 Token 的合同与系统日志审查、免 OCR 直接读 UI 截图写代码。
- 现存短板:输出速度(约 48.7 t/s)和首字延迟(1.52s)中规中矩;在极高难度的细粒度视觉识别(如 BabyVision、MVbench)上仍略落后于 Gemini 3.7 Flash。
看点 5:开源了,但我能本地部署吗?
- 私有化门槛:虽然按 MIT 协议开源了权重,但默认 FP8 权重在未装载 KV Cache 前就需要占满 306 GiB 显存,且当前 vLLM 方案限定 NVIDIA Hopper 及以上架构。这意味着本地部署至少需要 单机 8 卡高端计算节点。
- 选型结论:除非有极严格的合规内网需求,否则中小团队和个人开发者直接调用 API 或订阅 GLM Coding Plan 是性价比最高的方案。