← 首页

AI模型指南

GLM-5.3-Flash 完整指南:ox-alpha 真身

之前有个叫 ox-alpha 的匿名模型在 OpenRouter 和 OpenCode 上悄悄排名第一,没人知道来历。2026 年 8 月 26 日,智谱(Z.ai)揭晓答案:它就是 GLM-5.3-Flash,同日以 MIT 协议开源权重。本文说明它是什么、跑分能得出什么结论、价格中有什么坑,以及如何用 OpenClaw Launch 把它变成自己的 AI 助手。

GLM-5.3-Flash 是什么?

GLM-5.3-Flash 是一个 320B 总参数、约 18B 激活参数 的 MoE 模型,也是 GLM-5 系列中第一个原生多模态模型——支持文本、图片、视频 输入,输出文本。

注意:虽然叫 Flash,但它不是 GLM-5.3 的蒸馏小版本,而是全新预训练 + 全新架构,目标是在保持前沿能力的同时把推理成本压下来。智谱官方数据:相比 GLM-5.3,注意力计算量降低 3.01 倍,KV 缓存降低 4.44 倍

  • 稀疏注意力 + 线性注意力混合架构——线性注意力建模局部依赖,轻量索引器负责全局检索。智谱称这是首个采用该混合架构的开源前沿模型。
  • mHC(流形约束超连接) 提升扩展效率,配合 IndexPool(把 4 个索引器 key 向量加权池化成 1 个)压低 100 万 token 上下文的开销。
  • 30T token 多模态预训练语料;45 层,而参数量相近的 GLM-4.5 是 92 层、激活 32B。
  • MIT 协议,发布当天即开源权重——与 GLM-5.3 先上 API、约两周后才放权重的节奏明显不同。

ox-alpha 是怎么回事?

智谱官方确认:发布前,模型以 ox-alpha 的代号在 OpenCode 和 OpenRouter 上匿名测试,收集真实用户反馈,并迅速成为当周最受欢迎的模型。官方同时说明,这段时间的全部流量都跑在国产 AI 芯片集群上,推理栈基于 SGLang 自研。

说明:匿名测试的经过与流量归属均为智谱官方口径,本文如实转述,不做额外背书。

跑分:和 Opus 4.8 到底谁强?

Artificial Analysis 给 GLM-5.3-Flash 的智能指数是 57.5,编程 71.5,智能体 58.2。和 Claude Opus 4.8 放在同一把尺子上,结论是具体的,而不是笼统的「全面超越」:

模型智能指数编程智能体价格(输入 / 输出,每百万 token)
GLM-5.3-Flash57.571.558.2$0.075 / $0.25(限时价,标价 $0.15 / $0.50)
Claude Opus 4.857.374.349.4$5.00 / $25.00
GLM-5.359.574.859.1$1.40 / $4.40
GLM-5.252.668.845.7$1.40 / $4.40

诚实地读这张表:GLM-5.3-Flash 在综合智能指数上与 Opus 4.8 持平,在智能体任务上明显更强,在编程上略逊。价格差距要分清是哪个价:按现在的限时价,输入约为 Opus 4.8 的 1/70、输出约 1/100;恢复标价后仍有 1/33 和 1/50。对比 GLM-5.3 也一样——它没有任何一项超过 GLM-5.3,只是非常接近,而 token 成本按限时价约为其 5%,按标价约为 11%。

智谱自己公布的成绩(属厂商数据,请按厂商数据看待):DeepSWE v1.1 得 63.4,GLM-5.2 为 46.2;AutomationBench 得 48.8,GLM-5.2 为 26.2;在其内部 Z.ai Code Bench v1.0 上,max 档得 29.0,Opus 4.8 为 29.5。

价格:注意「限时」两个字

到处流传的那个便宜到离谱的价格是限时折扣价,不是标价。智谱官方公布的每百万 token 价格:

标价限时价
输入$0.15$0.075
缓存输入$0.03$0.015
输出$0.50$0.25

如果要规划一个长期跑的业务,请按标价算账。即使按标价,$0.15 / $0.50 也只有 GLM-5.3 的约十分之一。缓存输入的存储费用目前也是限时免费。

如果订阅的是 GLM Coding Plan 而不是按量付费:官方说明 GLM-5.3-Flash 的额度是 GLM-5.3 的 3 倍,采用积分制,非高峰时段以及整个周末只消耗 50% 积分。

用 OpenClaw Launch 部署 GLM-5.3-Flash

GLM-5.3-Flash 在 OpenRouter 上的模型 ID 是 z-ai/glm-5.3-flash,智谱官方 API 的模型编码是 glm-5.3-flash。两条路都支持 BYOK(自带 API Key):

  1. 打开 OpenClaw Launch,用 Google、GitHub 或邮箱注册,部署一个实例(约 30 秒上线)。注意:BYOK 自选模型需要付费计划,免费试用只能用固定的几个免费模型,所以试用适合先看产品,不适合试这个模型。
  2. 在控制台的 BYOK 设置里填入 OpenRouter Key 或智谱官方 API Key。
  3. 打开模型选择器,搜索 glm 5.3 flash。搜索会直接展开服务商的实时模型目录,不只是我们精选的那几个,所以新模型一上架就能选到。
  4. 选中即生效——不用重新部署,聊天记录和已连接的平台全部保留。
提示:模型可以随时在控制台切换,或在聊天里用 /model 命令切换。常见搭配是:日常用 GLM-5.3-Flash(便宜到可以一直挂着跑),遇到硬骨头再临时切到前沿模型。

自建服务器怎么配?

如果自己部署 OpenClaw,在 openclaw.json 里把默认智能体指向该模型:

{
  "models": {
    "providers": {
      "openrouter": {
        "apiKey": "sk-or-..."
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "openrouter/z-ai/glm-5.3-flash"
      }
    }
  }
}

部署前请到 openrouter.ai/models 核对当前的模型 ID,不要直接照抄任何教程(包括本文)——服务商的 ID 会随版本变动,用了过期的 ID 会直接报 model-not-found。

三个容易踩的坑

一、思考模式关不掉。这个模型的推理是强制的——智谱 API 的 thinking.type 只接受 enabled,OpenRouter 也标注推理为必选、默认强度为 max。如果习惯在便宜模型上关掉思考来省输出 token 和延迟,这里没有这个开关,请把推理 token 算进输出成本。

二、官方推荐参数不太常规。temperature 1top_p 0.95reasoning_effort: maxthinking.clear_thinking: false;流式请求建议同时开 streamtool_stream

三、上下文上限取决于具体服务商。OpenRouter 目录里标的是最高 1,310,720 token,但主力服务商实际提供 1,048,576 token、最大输出 131,072 token。做长上下文规划时,请按实际计费的那个端点算,而不是目录里的最大值。

想自己跑权重?

权重以 MIT 协议开源在 Hugging Face 的 zai-org/GLM-5.3-Flash,官方给出了 SGLang、vLLM、TokenSpeed、KTransformers 四套部署方案。但要有心理准备:即便激活只有 18B,320B 总参数依然是很重的托管成本,个人本地跑基本要走社区量化版而不是完整 BF16 权重。想今天就把智能体跑起来,用 API Key 是更短的路。

什么场景该选它?

选择适用场景
GLM-5.3-Flash高频调用的智能体、长时间多轮工具调用、需要读截图/视频的任务;以及任何「成本决定了能不能一直开着」的场景
GLM-5.3硬核代码和安全审查要最强的 GLM,且成本不是约束
DeepSeek V4 Flash纯文本场景,且已经有 DeepSeek 的 Key 和现成链路
Claude Opus写代码就是全部工作,且愿意为最后几个跑分点付出上百倍的账单

真正有意思的是那个以前算不过账的场景:一个全天候盯着群聊、不停调工具、还要看截图的智能体,现在可以一直开着,而不用担心 token 账单成为关掉它的理由。

常见问题

ox-alpha 到底是什么模型?

就是智谱 GLM-5.3-Flash。发布前以匿名代号 ox-alpha 在 OpenRouter 和 OpenCode 上测试,官方称其成为当周最受欢迎的模型,2026 年 8 月 26 日正式揭晓身份。

GLM-5.3-Flash 真的能打过 Opus 4.8 吗?

综合智能指数上是持平(57.5 对 57.3),智能体任务上更强(58.2 对 49.4),编程上略逊(71.5 对 74.3)。可以说「同一档」,但不能说「全面超越」。

用 GLM-5.3-Flash 要花多少钱?

模型侧:标价每百万 token 输入 $0.15、输出 $0.50,目前限时半价($0.075 / $0.25),按量计费。托管侧:Lite 计划首月 $3、之后 $6/月,Pro 计划 $20/月,支持支付宝和微信支付(BYOK 自选模型需要付费计划)。

可以从 GLM-5.2 直接切过来吗?

可以。在控制台的模型选择器里搜索并切换即可,无需重新部署,聊天历史和平台连接均保留不变。

开始使用

更多国产模型对比见 模型对比页面最便宜的模型盘点;也可以看看 GLM-5.2 部署教程DeepSeek V4 ProKimi K3 指南

30 秒部署 GLM-5.3-Flash AI 助手

用智能指数与 Opus 4.8 持平、token 成本却低一到两个数量级的模型,部署到 Telegram / Discord / 微信。自带 OpenRouter 或智谱 API Key,首月 $3、之后 $6/月,支持支付宝和微信支付。

立即部署