视频模型指南
Vidu S2:实时数字人、视频编辑与 API 接入
边生成边交流,随时替换衣服、物品或背景。了解 Vidu S2 的模式、会话计费,以及 Hermes Agent 和 OpenClaw 当前的接入范围。
视频开始实时回应,究竟改变了什么?
普通视频 API 的流程是输入提示词、创建任务、等待短片。Vidu S2 官网介绍的是持续运行的视频流:你可以在交互过程中加入语音、动作指令或新的参考图,让角色继续回应;编辑模式则直接改变输入的视频流。
官方更新记录在 2026 年 9 月 15 日列出了 S2-Avatar 和 S2-Editing。技术报告描述了 720p 实时数字人,并探索面向 VR 的空间视频。VR 部分属于研究探索,不能据此认定已有面向普通用户的完整产品。本文没有独立测试延迟、帧率或画质排名。
先选数字人,还是实时编辑
| 模式 | 你提供什么 | 谁负责交互链路 |
|---|---|---|
| Avatar 实时交互 | 角色图片、用户音视频 | Vidu 提供 RTC、语音识别、语言回复和语音合成 |
| Avatar 组件模式 | 角色音频、动作文本 | 应用自行提供 RTC、ASR、LLM、TTS,Vidu 渲染角色 |
| Editing 实时编辑 | 输入视频流、替换参考图 | Vidu 提供 RTC;应用需要流媒体客户端 |
官方模式表还列出了返回 MP4 的异步数字人流程。不过,离线端点的示例仍使用 S1,不能直接沿用组件模式的 S2 参数。复制代码之前,先确认自己要的是实时对话、已有语音链路的角色渲染,还是最终视频文件。
试数字人时,可以先用清晰的单人肖像和一条简单动作指令,等画面稳定后再换衣服或背景。实时编辑可以从摄像头、视频或图片开始,每次只替换一个元素。用同一个输入比较两个背景,再检查脸部、物体边缘和连续动作,比一次改变所有条件更容易发现问题。
先跑官方演示客户端
- 打开官方 Quick Start,在 API 平台创建自己的 Key,确认账户已开通实时能力并有足够积分。
- 使用教程提供的 Python 脚本和浏览器客户端。教程要求 Python 3.10 或以上,本地客户端默认地址为
http://127.0.0.1:28890。 - Key 和接口环境要对应:演示默认使用
api.vidu.cn,全球环境使用api.vidu.com。不要假设同一把 Key 在两个环境都有效。 - 选择文档支持的模式,创建并连接会话。按实际输入需要授予麦克风或摄像头权限,检查 live 状态、连接确认和 RTC 加入结果。
- 完成一次短测试后点击 Hang Up,确认服务端会话已结束,再查看用量。
生产应用应把 API Key 留在后端。浏览器只接收连接当前会话所需的信息。演示脚本的启动参数可能暴露 Key,不适合直接充当生产部署方案。创建请求成功也不等于已经播放视频,还要确认媒体连接。
开发接入:先实现完整的会话生命周期
组件模式创建文档明确使用 model: "vidu-s2",当前标注为 beta;默认值仍是 vidu-s1。目录里的 vidu-s2-avatar、vidu-s2-editing 是展示名称,不能直接当成创建接口的 model 值。
如果你已有 RTC 频道,下面是官方组件接口的请求结构。替换所有占位符,使用你有权用于数字人生成的图片。由后端向 POST https://api.vidu.cn/live/s_avatar/component 发送 JSON,认证头为 Authorization: Token $VIDU_API_KEY;全球 Key 应使用对应的全球域名。这会创建付费会话,本文未实际执行。
{
"model": "vidu-s2",
"image_uri": "https://example.com/avatar.jpg",
"rtc_info": {
"provider": "agora",
"app_id": "your-rtc-app-id",
"channel_id": "your-channel-id",
"user_id": "uid-123",
"token": "your-rtc-token"
}
}响应包含 live.id 和会话级 client_secret。按组件模式协议完成 WebSocket 初始化和心跳,再发送 24 kHz、单声道、16 位小端有符号 PCM 音频;视频输出走你提供的 RTC 频道。完整实时交互模式的控制 WebSocket 不接收二进制音视频,不能混用这两套协议。
后端需要保存会话 ID,处理创建、准备、连接、输入更新和主动停止。加入短时限、断线处理和失败清理,避免浏览器刷新后失去停止会话的入口。智能体可以协调这些操作,实际媒体连接仍由应用客户端处理。
组件模式适合已有对话系统:后端生成文本,TTS 合成语音,S2 驱动角色画面。完整实时数字人模式则使用 Vidu 的对话链路。把聊天模型换成 S2,并不会自动产生这套音视频界面。
积分怎样算?
| 模式 | 文档费率 | 启动余额要求 |
|---|---|---|
| Avatar 实时交互 | 每 2 秒 3 积分,时长向上取整到 2 秒单位 | 至少 45 积分 |
| Avatar 组件模式 | 每秒 1 积分 | 至少 45 积分 |
| Editing | 每秒 1 积分 | 未核实具体门槛 |
费率来自实时数字人、组件模式和编辑接口文档。按这些费率,60 秒计费时长的实时交互是 90 积分,60 秒组件或编辑会话是 60 积分。Avatar 模式的 45 积分是账户余额门槛,不是每次至少扣 45 积分。
实时交互的计费起点是文档规定的 on_live/连接初始化确认条件,不能只看屏幕上播放了几秒。实时交互文档规定单次最长 7,200 秒,首次测试应设更短的上限。结束后查询服务端的 billed_seconds 和 credits_cost,核对实际扣费。
资源包、区域价格和并发额度以当前账户页面为准,积分不能按一个固定美元汇率理解。组件模式使用的 RTC 服务也可能另行收费;托管智能体订阅与 Vidu 用量分开计算。
自部署 Hermes Agent:连接你自己的桥接服务
Hermes 的上游 MCP 文档支持启动本地工具服务。以下配置模板以你已经开发并验证的桥接服务为前提。/srv/vidu-s2-bridge/server.py 是你自己的程序路径,本文没有提供同名的官方 Vidu 软件包。
# ~/.hermes/config.yaml
mcp_servers:
vidu_s2:
command: python3
args: ["/srv/vidu-s2-bridge/server.py"]打开新的 hermes chat 会话,确认工具已经出现。Key、预算上限和会话归属由桥接服务处理;只暴露必要的状态查询、停止等操作,开始付费流媒体前要求明确确认。画面在你自己的应用客户端中显示。
自部署 OpenClaw:注册同一个桥接服务
近期 OpenClaw 上游提供内置 MCP 客户端。先核对安装版本是否支持文档中的命令,再注册已可运行的 stdio 服务:
openclaw mcp add vidu-s2 \
--command python3 \
--arg /srv/vidu-s2-bridge/server.py
openclaw mcp doctor vidu-s2 --probeDoctor 应能连接并列出服务真正提供的工具。探测成功只证明 MCP 连通,还需要独立验证 Vidu 鉴权、媒体流和停止计费流程。不要向聊天模型配置添加猜测出来的 S2 字段。
托管平台现在支持到哪里?
两个托管框架共享现有的 Vidu MCP 普通短视频接入。当前适配器支持 viduq3-turbo、viduq3-pro、viduq2 和 viduq1,执行创建任务和查询结果,尚未实现 S2 的实时会话流程。
要体验 S2,可先使用官方客户端或独立部署的应用。给现有 Vidu 连接填入 Key,或者在聊天模型选择器里改名称,都不会增加实时数字人界面。上面的自部署 MCP 配置是开发接入方案,不是托管平台已有的 S2 开关。
本文于 2026 年 10 月 4 日核对 Vidu 官方产品页、模式表、更新记录、Stream 文档、技术报告,以及两个框架的上游 MCP 文档。示例按文档整理,未运行付费视频会话或独立性能对比。
常见问题
Hermes Agent 可以用 Vidu S2 吗?
自部署 Hermes 可以调用你自行开发的 MCP 桥接服务。该服务需要实现 S2 会话管理,并配合独立的音视频客户端。本文没有验证现成的 S2 连接器,也没有在托管 Hermes 上执行付费生成测试。
现有 Vidu MCP 接入已经支持 S2 了吗?
没有。托管 Vidu MCP 目前创建和查询 Q 系列普通短视频任务。S2 需要实时会话和流媒体连接,现有接入不代表两个托管框架已经支持 S2。
现在就能用 S2 生成 VR 世界吗?
S2 技术报告探索了面向 VR 的空间视频。本文尚未验证公开的生产级 VR 接口或可下载的 VR 应用;这里介绍的已文档化流程是数字人和实时编辑。
Vidu S2 免费吗?
官方 API 按会话时长消耗积分,Avatar 模式启动时账户余额至少需要 45 积分。这是余额门槛,不是最低扣费。不同模式费率不同;结束时应主动挂断,并核对最终用量。