模型指南 · 核实于 2026 年 9 月 10 日
DeepSeek V4.1 Flash 正式发布:价格、API 与 Hermes / OpenClaw 接入教程
V4.1 Flash 已正式上线,原生支持视觉理解,推荐 API 名称变为 deepseek-flash。本文讲清楚怎么给爱马仕 Hermes Agent 或龙虾 OpenClaw 换上它、峰谷价格怎么算,以及旧版 Flash 和 Pro 何时切换。
这次发布了什么?
根据 DeepSeek 的官方发布文章,V4.1 Flash 是新架构系列中尺寸最小的模型:总参数 552B,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,并具备原生视觉理解能力。这与 V4 Flash 0731 版本只更新后训练的情况不同。
官方还称,新一代 KV Cache 对 HBM 的需求降至上一代的四分之一,对 SSD 的需求降至八分之一。这里说的是模型服务端的缓存开销,不能理解成你的机器人服务器只需要某个固定内存。公告同时给出了开源权重与技术报告入口。
deepseek-flash。下面的接入说明依据当前文档和提供商配置能力整理,不代表我们已完成所有智能体工具与图片场景的端到端测试。API 模型名怎么填?旧模型何时迁移?
| DeepSeek 直连模型名 | 当前行为 |
|---|---|
deepseek-flash | 新配置推荐使用,对应 V4.1 Flash。 |
deepseek-v4-flash | 旧名称仍可调用,已转到 V4.1 Flash。 |
deepseek-v4-flash-vision-exp | 旧视觉模型名称仍可调用,已转到 V4.1 Flash。 |
deepseek-v4-pro | 北京时间 9 月 14 日 12:00 起转到 V4.1 Flash,持续至 V4.1 Pro 上线。 |
迁移规则来自官方首次调用说明,适用于 DeepSeek 自己的 API。OpenRouter、OpenCode 套餐与 DeepSeek 直连是不同路线,不能只看界面上写着“Flash”就认定底层版本相同。
V4.1 Flash 价格:按峰谷时段计费
以下为官方直连 API 的人民币价格,单位是每百万 tokens。公告说明新价格于北京时间 2026 年 9 月 10 日 12:00 生效。
| 类型 | 空闲时段 | 高峰时段 |
|---|---|---|
| 输入,缓存命中 | ¥0.02 | ¥0.04 |
| 输入,缓存未命中 | ¥1 | ¥2 |
| 输出 | ¥4 | ¥8 |
高峰时段是北京时间周一至周五 09:00–12:00、14:00–18:00,其他时间为空闲时段。官方模型与价格页同时列出 1M 上下文、最大 384K 输出、思考与非思考模式,以及工具调用、JSON 输出、Responses API、Anthropic 兼容接口和视觉支持。
举例:100 万未命中缓存的输入 tokens,加 10 万输出 tokens,空闲时段为 ¥1.40,高峰时段为 ¥2.80。这是用量算例,不是“一次任务”的固定价格;智能体处理一个任务可能反复调用模型。可以把不赶时间的批处理放到空闲时段,再根据实际账单决定预算。服务器托管费和第三方提供商费用另算。
在 OpenClaw Launch 上接入:Hermes 和 OpenClaw 步骤相同
爱马仕指 Hermes Agent,龙虾指 OpenClaw。两种助手使用同一个模型选择器;直连 DeepSeek 时按下面操作:
- 在 DeepSeek 开放平台创建自己的 API 密钥,并确认账户有可用余额。
- 打开 OpenClaw Launch 的 API 密钥页面,在 DeepSeek 区域保存密钥。
- 打开机器人模型选择器,选择使用你自己密钥的 DeepSeek 提供商。实时目录出现
deepseek-flash时优先选它;如果仍显示deepseek-v4-flash,这个旧名称在官方直连 API 上也能访问新模型。 - 新开一段对话,检查所选提供商与模型。这样评估新模型时,不会把旧会话累积的上下文问题混在一起。
图片还需要客户端与模型目录正确传递。旧目录如果把 Flash 标记为纯文本,上游支持视觉并不意味着界面会自动开放图片输入。明确的图片请求格式见官方图像理解说明。视觉理解用于读图、截图和图表,不是生成图片。
自己部署 Hermes Agent:提供商和模型分开填写
使用 Hermes 的 DeepSeek 提供商,并配置自己的密钥。把以下设置合并到已有文件中,保留原有工具和网关配置:
# ~/.hermes/.env
DEEPSEEK_API_KEY=YOUR_OWN_DEEPSEEK_KEY
# ~/.hermes/config.yaml
model:
provider: deepseek
default: deepseek-flash
context_length: 1000000
supports_vision: true也可以运行 hermes model 交互式设置。model.default 使用不带提供商前缀的模型名,不能直接套用 OpenClaw 的写法。参考 Hermes 上游仓库和 Hermes DeepSeek 接入指南。
自己部署 OpenClaw:显式配置兼容 API 提供商
在 ~/.openclaw/.env 中保存自己的 DEEPSEEK_API_KEY,让网关进程能够读取,再把下面片段合并到 ~/.openclaw/openclaw.json。这里显式声明模型,避免依赖尚未更新的内置目录:
{
"models": {
"mode": "merge",
"providers": {
"deepseek-direct": {
"baseUrl": "https://api.deepseek.com/v1",
"apiKey": "${DEEPSEEK_API_KEY}",
"api": "openai-completions",
"models": [{
"id": "deepseek-flash",
"name": "DeepSeek V4.1 Flash",
"reasoning": false,
"input": ["text", "image"],
"contextWindow": 1000000,
"maxTokens": 384000
}]
}
}
},
"agents": {
"defaults": {
"model": { "primary": "deepseek-direct/deepseek-flash" },
"models": {
"deepseek-direct/deepseek-flash": {
"params": {
"extra_body": { "thinking": { "type": "disabled" } }
}
}
}
}
}
}这个入门配置刻意关闭思考模式:当前 OpenClaw 的 DeepSeek 适配器在处理工具调用之间的推理信息时,可能仍只匹配旧模型名。模型本身支持思考,但开启前应确认客户端版本已适配。保留已有频道、模型条目和凭证;字段请对照 OpenClaw 上游提供商文档。API 的上下文和输出上限不是每次任务都应该用满的预算。
遇到问题,先分清 API 和智能体两层
用自己的密钥执行下面的小请求,可先检查接口与账户是否正常。这个请求会消耗少量 API tokens;关闭思考模式是为了让连通性检查保持简短:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-flash",
"messages": [{"role": "user", "content": "Reply with OK."}],
"thinking": {"type": "disabled"},
"max_tokens": 32,
"stream": false
}'接口返回成功只说明密钥和 endpoint 正常,不等于工具调用、频道和图片附件都已配置完成。找不到模型时,先检查提供商和模型目录;鉴权失败时检查 DeepSeek 密钥;余额不足时检查密钥所属账户,不要误查另一个聚合平台的余额。
常见问题
DeepSeek V4.1 Flash 现在能用了吗?
能。DeepSeek 于 2026 年 9 月 10 日正式发布,官方 API 文档已将 deepseek-flash 对应版本标为 DeepSeek-V4.1-Flash。本文核实的是公告与文档,没有把文档核实当作智能体端到端实测或独立跑分。
Hermes Agent(爱马仕)可以用吗?
可以通过 Hermes 的 DeepSeek 提供商接入:provider 填 deepseek,model.default 填不带提供商前缀的 deepseek-flash,并配置自己的 DeepSeek API 密钥。托管平台上的模型选择步骤与 OpenClaw 相同。
原来的 Flash 用户要重新部署机器人吗?
如果直连 DeepSeek,旧名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 已转到 V4.1 Flash,不需要因为模型升级而重建机器人。新配置建议使用 deepseek-flash。通过 OpenRouter 等第三方访问时,要以该平台的模型目录和迁移说明为准。
V4 Pro 已经全部变成 Flash 了吗?
截至 9 月 10 日,不能这样说。官方公布的切换时间是北京时间 2026 年 9 月 14 日 12:00;此后至 V4.1 Pro 上线前,直连 deepseek-v4-pro 的请求会按 V4.1 Flash 提供服务和计费。
小服务器能部署这个开源模型吗?
部署 Hermes 或 OpenClaw 程序与部署模型权重是两回事。V4.1 Flash 公布的总参数量为 552B;普通智能体服务器运行的是调用 API 的助手程序,不是这个大模型的完整推理服务。
自己维护服务器,还是使用托管?
自部署适合希望掌控运行环境、愿意处理更新与排障的人;托管适合希望直接配置助手的人。OpenClaw Launch 托管首月 $3,之后每月 $6,支持支付宝和微信支付。本文的 DeepSeek BYOK 用量由你自己的 DeepSeek 账户计费,与托管费分开。
继续了解 Hermes 托管、OpenClaw 部署教程、DeepSeek 机器人,或查看 V4 Pro 背景说明。