AI模型指南
GLM-5.3-FlashX 完整指南:Flash 的加速版
2026 年 9 月 18 日,智谱上线 GLM-5.3-FlashX,API 同步开放。它不是新模型——基座仍是 GLM-5.3-Flash(320B 总参数 / 18B 激活、原生多模态、1M 上下文),变化在推理侧:最高 200 tokens/s,智谱称约为 Flash 的 5 倍速,价格提升到 2.5 倍。本文说明它和 Flash 到底差在哪、这笔钱该不该花,以及如何用 OpenClaw Launch 把它变成自己的 AI 助手。
GLM-5.3-FlashX 是什么?
FlashX 是同一个 GLM-5.3-Flash 基座的高速服务版本:320B 总参数、约 18B 激活,原生多模态(文本、图片、视频输入,文本输出),1M 上下文窗口,最大输出 128K。智谱这次没有公布新的跑分或架构变化——因为权重没变,变的只是背后的推理基础设施。
换句话说,选 FlashX 买的是 「更快的响应速度」,不是「更聪明的模型」。官方对它的定位是:GLM-5.3-Flash 长期保持同尺寸最强智能,FlashX 在此基础上把输出速度大幅提升,用价格换时延。
- 最高 200 tokens/s,智谱称较 GLM-5.3-Flash 提升约 5 倍。注意「最高」二字——这是上限,不是平均值,实际速度取决于负载。
- 能力不变:同样的 320B/18B 基座、同样的多模态输入、同样的 1M 上下文与 128K 最大输出。
- 价格提升到 2.5 倍:每百万 token 输入 $0.37 / 输出 $1.25,而 Flash 是 $0.15 / $0.50。
- GLM Coding Plan 暂不支持:官方文档写明套餐当前开放的是 GLM-5.3-Flash(额度为 GLM-5.3 的 3 倍),暂未开放 GLM-5.3-FlashX。
为什么会有 FlashX?
Flash 的热度超出预期。智谱表示,GLM-5.3-Flash 上线后调用量持续攀升,此前由 10 万张国产芯片组成的推理集群「上线即被打满」。于是智谱进一步扩大算力并做推理优化:采用生产级 EPD(Encode–Prefill–Decode)分离式架构,把多模态编码、prompt 预填充和逐 token 解码拆成可独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升约 3 倍。
智谱还提到,它由 GLM-5.3 驱动的 Infra Agent 协助工程师优化算子、诊断性能瓶颈,形成了「模型优化系统、系统承载模型」的循环。FlashX 就是这轮 Infra 投入的付费产出:与其把快路径限量供应,不如单独定价。
说明:关于集群规模、提速幅度与 Infra Agent 的描述均为智谱官方口径,本文如实转述,不做额外背书。
价格:2.5 倍,买的是时延
智谱公布的每百万 token 价格(国际站 / Z.ai,美元):
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GLM-5.3-FlashX | $0.37 | $0.075 | $1.25 |
| GLM-5.3-Flash | $0.15 | $0.03 | $0.50 |
国内智谱开放平台(bigmodel.cn)对应的价格(元 / 百万 token):
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GLM-5.3-FlashX | ¥2.0 | ¥0.57 | ¥7.0 |
| GLM-5.3-Flash | ¥0.8 | ¥0.23 | ¥2.8 |
两边的比例一致,都是 2.5 倍(国内 0.8 × 2.5 = 2.0、2.8 × 2.5 = 7.0)。缓存存储费用目前限时免费。需要把推理 token 计入输出成本——这个模型关不掉思考。
所以问题不是「FlashX 值不值」,而是「卡住你的是不是时延」。同一份答案,贵 2.5 倍:有人的时候通常值——客服机器人、实时编码、每轮要跑十几步工具调用的 Agent,200 tokens/s 让一段长答案几秒内出完,体验完全不同;没人在等的时候通常不值——跑通宵的研究、批量文档处理、定时任务,Flash 产出同样结果但更便宜。
如何用上 GLM-5.3-FlashX
智谱官方 API 的模型编码是 glm-5.3-flashx。有两点先讲清楚:FlashX 暂不支持 GLM Coding Plan(需要用按量付费的标准 Key,不能用编程套餐 Key);且截至本文发布,OpenRouter 的模型目录里只有 z-ai/glm-5.3-flash,还没有上架 FlashX。所以现在有两条路。
- 智谱官方 API 直连(今天就能用)——按下面的自建配置接入,或在任何能填模型 ID 的地方使用。
- 托管平台(OpenClaw Launch)——控制台的模型选择器列出的是所接入服务商提供的模型,所以等智谱目录(经 models.dev)或 OpenRouter 上架 FlashX 后,就能在这里直接选到。在那之前,同一个 320B/18B 基座可以用 OpenRouter Key 选到
z-ai/glm-5.3-flash,价格还便宜 2.5 倍。BYOK 自选模型需要付费计划,免费试用只能用固定的几个免费模型。
/model 命令切换即可,上下文会保留。自建服务器怎么配?
如果自己部署 OpenClaw,在 openclaw.json 里配置智谱直连并指向 FlashX。注意两站 Key 与地址要对应:国际站 Z.ai 用 https://api.z.ai/api/paas/v4,国内智谱开放平台 用 https://open.bigmodel.cn/api/paas/v4,拿 A 站的 Key 打 B 站的地址会直接报鉴权或 model-not-found。下面以国际站为例:
{
"models": {
"providers": {
"zai": {
"baseUrl": "https://api.z.ai/api/paas/v4",
"apiKey": "你的智谱 Key",
"api": "openai-completions",
"models": [
{ "id": "glm-5.3-flashx", "name": "GLM 5.3 FlashX" }
]
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "zai/glm-5.3-flashx"
}
}
}
}想走 OpenRouter,同一个基座在那边是 openrouter/z-ai/glm-5.3-flash;如果之后上架 FlashX,ID 大概率是同一形状的 openrouter/z-ai/glm-5.3-flashx。部署前请到 openrouter.ai/models 核对当前的型号 ID,不要直接照抄任何教程(包括本文)——用过期的 ID 会直接报 model-not-found。
三个容易踩的坑
一、思考模式关不掉。Flash 系列强制推理——智谱 API 的 thinking.type 只接受 enabled,OpenRouter 也标注推理为必选、默认强度 max。如果你习惯在便宜模型上关掉思考来省输出 token 和延迟,这里没有这个开关;而且对 FlashX 来说,推理 token 恰恰是它想帮你更快产出的部分。
二、推荐参数是同样那套非常规设置。temperature 1、top_p 0.95、reasoning_effort: max、thinking.clear_thinking: false;流式请求建议同时开 stream 和 tool_stream——200 tokens/s 的提速只有在流式输出时才看得出来,非流式调用会把整个优势藏成一次长时间等待。
三、GLM Coding Plan 暂不支持 FlashX。如果你订阅的是编程套餐而不是按量付费:官方说明套餐开放的是 GLM-5.3-Flash(额度为 GLM-5.3 的 3 倍),FlashX 暂未开放。在套餐内请用 Flash,想用 FlashX 就先走按量付费。
该选哪个?
| 选择 | 适用场景 |
|---|---|
| GLM-5.3-FlashX | 实时交互、高频调用的 Agent、每轮都有人在等、时延决定「能不能用」的场景 |
| GLM-5.3-Flash | 其余全部场景——同样的智能,价格只有 2.5 分之一,包括批量任务、定时任务和高并发后台 Agent |
| GLM-5.3 | 硬核代码和安全审查要最强的 GLM,且成本不是约束 |
| DeepSeek V4 Flash | 纯文本场景,且已经有 DeepSeek 的 Key 和现成链路 |
一句话:FlashX 不会让你的 Agent 更聪明,只会让它感觉更快。当「快」本身就是产品体验时买它;不需要时留在 Flash。
常见问题
GLM-5.3-FlashX 是新模型吗?
不是。它和 GLM-5.3-Flash 是同一个基座、同一套权重,区别在推理侧:最高 200 tokens/s(约 5 倍),价格为 2.5 倍。智谱没有公布新的跑分或架构变化。
GLM-5.3-FlashX 要花多少钱?
模型侧:国际站每百万 token 输入 $0.37、输出 $1.25(缓存输入 $0.075);国内 2.0 元 / 7.0 元。都是 Flash 的 2.5 倍,按量计费。托管侧:Lite 计划首月 $3、之后 $6/月,Pro 计划 $20/月,支持支付宝和微信支付(BYOK 自选模型需要付费计划)。
FlashX 比 Flash 快多少?
智谱称最高可达 200 tokens/s,约为 GLM-5.3-Flash 的 5 倍。这是官方口径的「上限」,实际速度受负载影响;第三方观测到的 Flash 输出速度大致在 50–75 tokens/s 区间。
可以从 GLM-5.3-Flash 直接切过来吗?
可以。在控制台的模型选择器里搜索并切换即可,无需重新部署,聊天历史和平台连接均保留不变。两者接口完全兼容,只改模型名即可。
开始使用
更多国产模型对比见 模型对比页面 和 最便宜的模型盘点;也可以看看 GLM-5.3-Flash 完整指南、GLM-5.2 部署教程、DeepSeek V4 Pro、Kimi K3 指南。