← 首页

AI模型指南

GLM-5.3-FlashX 完整指南:Flash 的加速版

2026 年 9 月 18 日,智谱上线 GLM-5.3-FlashX,API 同步开放。它不是新模型——基座仍是 GLM-5.3-Flash(320B 总参数 / 18B 激活、原生多模态、1M 上下文),变化在推理侧:最高 200 tokens/s,智谱称约为 Flash 的 5 倍速,价格提升到 2.5 倍。本文说明它和 Flash 到底差在哪、这笔钱该不该花,以及如何用 OpenClaw Launch 把它变成自己的 AI 助手。

GLM-5.3-FlashX 是什么?

FlashX 是同一个 GLM-5.3-Flash 基座的高速服务版本:320B 总参数、约 18B 激活,原生多模态(文本、图片、视频输入,文本输出),1M 上下文窗口,最大输出 128K。智谱这次没有公布新的跑分或架构变化——因为权重没变,变的只是背后的推理基础设施。

换句话说,选 FlashX 买的是 「更快的响应速度」,不是「更聪明的模型」。官方对它的定位是:GLM-5.3-Flash 长期保持同尺寸最强智能,FlashX 在此基础上把输出速度大幅提升,用价格换时延。

  • 最高 200 tokens/s,智谱称较 GLM-5.3-Flash 提升约 5 倍。注意「最高」二字——这是上限,不是平均值,实际速度取决于负载。
  • 能力不变:同样的 320B/18B 基座、同样的多模态输入、同样的 1M 上下文与 128K 最大输出。
  • 价格提升到 2.5 倍:每百万 token 输入 $0.37 / 输出 $1.25,而 Flash 是 $0.15 / $0.50。
  • GLM Coding Plan 暂不支持:官方文档写明套餐当前开放的是 GLM-5.3-Flash(额度为 GLM-5.3 的 3 倍),暂未开放 GLM-5.3-FlashX

为什么会有 FlashX?

Flash 的热度超出预期。智谱表示,GLM-5.3-Flash 上线后调用量持续攀升,此前由 10 万张国产芯片组成的推理集群「上线即被打满」。于是智谱进一步扩大算力并做推理优化:采用生产级 EPD(Encode–Prefill–Decode)分离式架构,把多模态编码、prompt 预填充和逐 token 解码拆成可独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升约 3 倍。

智谱还提到,它由 GLM-5.3 驱动的 Infra Agent 协助工程师优化算子、诊断性能瓶颈,形成了「模型优化系统、系统承载模型」的循环。FlashX 就是这轮 Infra 投入的付费产出:与其把快路径限量供应,不如单独定价。

说明:关于集群规模、提速幅度与 Infra Agent 的描述均为智谱官方口径,本文如实转述,不做额外背书。

价格:2.5 倍,买的是时延

智谱公布的每百万 token 价格(国际站 / Z.ai,美元):

模型输入缓存输入输出
GLM-5.3-FlashX$0.37$0.075$1.25
GLM-5.3-Flash$0.15$0.03$0.50

国内智谱开放平台(bigmodel.cn)对应的价格(元 / 百万 token):

模型输入缓存输入输出
GLM-5.3-FlashX¥2.0¥0.57¥7.0
GLM-5.3-Flash¥0.8¥0.23¥2.8

两边的比例一致,都是 2.5 倍(国内 0.8 × 2.5 = 2.0、2.8 × 2.5 = 7.0)。缓存存储费用目前限时免费。需要把推理 token 计入输出成本——这个模型关不掉思考。

所以问题不是「FlashX 值不值」,而是「卡住你的是不是时延」。同一份答案,贵 2.5 倍:有人的时候通常值——客服机器人、实时编码、每轮要跑十几步工具调用的 Agent,200 tokens/s 让一段长答案几秒内出完,体验完全不同;没人在等的时候通常不值——跑通宵的研究、批量文档处理、定时任务,Flash 产出同样结果但更便宜。

如何用上 GLM-5.3-FlashX

智谱官方 API 的模型编码是 glm-5.3-flashx。有两点先讲清楚:FlashX 暂不支持 GLM Coding Plan(需要用按量付费的标准 Key,不能用编程套餐 Key);且截至本文发布,OpenRouter 的模型目录里只有 z-ai/glm-5.3-flash还没有上架 FlashX。所以现在有两条路。

  • 智谱官方 API 直连(今天就能用)——按下面的自建配置接入,或在任何能填模型 ID 的地方使用。
  • 托管平台(OpenClaw Launch)——控制台的模型选择器列出的是所接入服务商提供的模型,所以等智谱目录(经 models.dev)或 OpenRouter 上架 FlashX 后,就能在这里直接选到。在那之前,同一个 320B/18B 基座可以用 OpenRouter Key 选到 z-ai/glm-5.3-flash,价格还便宜 2.5 倍。BYOK 自选模型需要付费计划,免费试用只能用固定的几个免费模型。
提示:等 FlashX 进入选择器后,不必二选一。常见搭配是日常用 GLM-5.3-Flash(便宜到可以一直挂着跑),需要交互时临时切到 FlashX,在控制台或用聊天里的 /model 命令切换即可,上下文会保留。

自建服务器怎么配?

如果自己部署 OpenClaw,在 openclaw.json 里配置智谱直连并指向 FlashX。注意两站 Key 与地址要对应:国际站 Z.aihttps://api.z.ai/api/paas/v4国内智谱开放平台https://open.bigmodel.cn/api/paas/v4,拿 A 站的 Key 打 B 站的地址会直接报鉴权或 model-not-found。下面以国际站为例:

{
  "models": {
    "providers": {
      "zai": {
        "baseUrl": "https://api.z.ai/api/paas/v4",
        "apiKey": "你的智谱 Key",
        "api": "openai-completions",
        "models": [
          { "id": "glm-5.3-flashx", "name": "GLM 5.3 FlashX" }
        ]
      }
    }
  },
  "agents": {
    "defaults": {
      "model": {
        "primary": "zai/glm-5.3-flashx"
      }
    }
  }
}

想走 OpenRouter,同一个基座在那边是 openrouter/z-ai/glm-5.3-flash;如果之后上架 FlashX,ID 大概率是同一形状的 openrouter/z-ai/glm-5.3-flashx。部署前请到 openrouter.ai/models 核对当前的型号 ID,不要直接照抄任何教程(包括本文)——用过期的 ID 会直接报 model-not-found。

三个容易踩的坑

一、思考模式关不掉。Flash 系列强制推理——智谱 API 的 thinking.type 只接受 enabled,OpenRouter 也标注推理为必选、默认强度 max。如果你习惯在便宜模型上关掉思考来省输出 token 和延迟,这里没有这个开关;而且对 FlashX 来说,推理 token 恰恰是它想帮你更快产出的部分。

二、推荐参数是同样那套非常规设置。temperature 1top_p 0.95reasoning_effort: maxthinking.clear_thinking: false;流式请求建议同时开 streamtool_stream——200 tokens/s 的提速只有在流式输出时才看得出来,非流式调用会把整个优势藏成一次长时间等待。

三、GLM Coding Plan 暂不支持 FlashX。如果你订阅的是编程套餐而不是按量付费:官方说明套餐开放的是 GLM-5.3-Flash(额度为 GLM-5.3 的 3 倍),FlashX 暂未开放。在套餐内请用 Flash,想用 FlashX 就先走按量付费。

该选哪个?

选择适用场景
GLM-5.3-FlashX实时交互、高频调用的 Agent、每轮都有人在等、时延决定「能不能用」的场景
GLM-5.3-Flash其余全部场景——同样的智能,价格只有 2.5 分之一,包括批量任务、定时任务和高并发后台 Agent
GLM-5.3硬核代码和安全审查要最强的 GLM,且成本不是约束
DeepSeek V4 Flash纯文本场景,且已经有 DeepSeek 的 Key 和现成链路

一句话:FlashX 不会让你的 Agent 更聪明,只会让它感觉更快。当「快」本身就是产品体验时买它;不需要时留在 Flash。

常见问题

GLM-5.3-FlashX 是新模型吗?

不是。它和 GLM-5.3-Flash 是同一个基座、同一套权重,区别在推理侧:最高 200 tokens/s(约 5 倍),价格为 2.5 倍。智谱没有公布新的跑分或架构变化。

GLM-5.3-FlashX 要花多少钱?

模型侧:国际站每百万 token 输入 $0.37、输出 $1.25(缓存输入 $0.075);国内 2.0 元 / 7.0 元。都是 Flash 的 2.5 倍,按量计费。托管侧:Lite 计划首月 $3、之后 $6/月,Pro 计划 $20/月,支持支付宝和微信支付(BYOK 自选模型需要付费计划)。

FlashX 比 Flash 快多少?

智谱称最高可达 200 tokens/s,约为 GLM-5.3-Flash 的 5 倍。这是官方口径的「上限」,实际速度受负载影响;第三方观测到的 Flash 输出速度大致在 50–75 tokens/s 区间。

可以从 GLM-5.3-Flash 直接切过来吗?

可以。在控制台的模型选择器里搜索并切换即可,无需重新部署,聊天历史和平台连接均保留不变。两者接口完全兼容,只改模型名即可。

开始使用

更多国产模型对比见 模型对比页面最便宜的模型盘点;也可以看看 GLM-5.3-Flash 完整指南GLM-5.2 部署教程DeepSeek V4 ProKimi K3 指南

30 秒部署一个 AI 助手

用智谱 Flash 家族——与 Opus 4.8 同档智能、最高 200 tokens/s——部署到 Telegram / Discord / 微信。现在可选 GLM-5.3-Flash,FlashX 上架选择器后一键切换。首月 $3、之后 $6/月,支持支付宝和微信支付。

立即部署