Google 图片模型指南
Nano Banana 2.1:参考图编辑、API 价格与接入
从一次商品换背景开始,了解 Google 新图片模型怎么用,以及 Hermes Agent、OpenClaw 各自的接入条件。
gemini-nano-banana-2.1。它用于生成和编辑图片,智能体的主聊天模型仍需单独配置。2.1 更新了什么?和 Nano Banana Pro 有什么区别?
Google 发布记录确认了上线时间,模型卡说明它基于 Gemini 3.6 Flash。官方模型页强调指令遵循、文字呈现和连续编辑的一致性有所改善。这些是官方描述,本文没有做独立画质对比测试。
| 名称 | Gemini API ID | 定位 |
|---|---|---|
| Nano Banana 2.1 | gemini-nano-banana-2.1 | 新版高效图片模型 |
| Nano Banana 2 | gemini-3.1-flash-image | 上一代;Google 建议新项目改用 2.1 |
| Nano Banana Pro | gemini-3-pro-image | 独立的高端图片模型 |
2.1 默认输出 1K,也支持 2K 和 4K。最多可提供 14 张参考图,官方列出的角色与物体一致性范围为最多 4 个角色、10 个物体。别为了凑满数量上传无关图片:先明确每张图负责什么。
先在 AI Studio 做一次商品换背景
- 打开 Google AI Studio,确认账户能选择 Nano Banana 2.1,并检查所选模型与计费状态。
- 上传一张清晰商品图,写出要改的部分和必须保留的细节。
- 先做 1K 草稿,对照原图检查。保存确认过的版本,再把它作为下一次编辑的参考。
- 构图确认后再生成高分辨率成品;最终尺寸下重新检查标签、边缘和小字。
以附图中的马克杯为商品参考。
只把背景换成浅蓝色摄影棚背景。
保留杯柄形状、印刷标志、拍摄角度和裁切范围。
光线从左侧柔和照入,不增加道具或文字。这是可自行改写的提示词起点。多图参考时,把用途写明,例如“图 1 提供商品外观,图 2 提供房间风格”。每次只改一个变量,出现偏差时更容易找出原因。
局部编辑:不要把“保留”当成像素锁定
官方编辑教程支持同时提供图片和文字。用语言描述修改区域即可;这里的例子没有额外传入蒙版参数。“其他部分保持不变”是一条指令,并不保证框外或主体的所有像素完全不变。
做电商图时,对照轮廓、标志拼写、零件数量、阴影和反光。条码要用扫描器验证,不能只看起来像条码。做海报时先准备准确文案,生成后逐行检查。模型卡仍列出姿态和空间关系方面的限制,输出也带有 SynthID。
官方 API:用一张参考图完成编辑
准备你自己的付费 Gemini API 项目和密钥,在独立 Python 环境安装或更新 google-genai。把真实 PNG 文件命名为 product.png,通过环境变量提供 GEMINI_API_KEY,不要把密钥写进代码或提示词。
python -m venv .venv
source .venv/bin/activate
python -m pip install --upgrade google-genai
python edit_product.py把下方保存为 edit_product.py。它按 Google 为 2.1 提供的 Interactions 编辑示例发起一次请求,并拒绝覆盖已有结果。纯文字生图时,移除图片输入,把文字改成场景描述。
import base64
import os
from pathlib import Path
from google import genai
source = Path("product.png") # A real PNG reference image
output = Path("product-edited.png")
if output.exists():
raise FileExistsError(output)
client = genai.Client(api_key=os.environ["GEMINI_API_KEY"])
result = client.interactions.create(
model="gemini-nano-banana-2.1",
input=[
{"type": "text", "text": "Replace only the background with pale blue. "
"Preserve the product shape, label, camera angle and crop."},
{"type": "image", "mime_type": "image/png",
"data": base64.b64encode(source.read_bytes()).decode("utf-8")},
],
)
image = result.output_image
if image is None or not image.data:
raise RuntimeError("No image returned; inspect the response before retrying")
with output.open("xb") as target:
target.write(base64.b64decode(image.data))
print(output.resolve())output_image 返回最后一个生成图片块;复杂的图文交错输出需要检查响应步骤。本文按文档核对代码,没有发起付费生图测试。若 SDK 没有 interactions,先在独立环境更新 SDK,别把模型 ID 改回旧版来绕过问题。
API 多少钱?
| 分辨率 | 标准调用 | Batch |
|---|---|---|
| 1K | $0.0336 | $0.0168 |
| 2K | $0.0504 | $0.0252 |
| 4K | $0.113 | $0.0567 |
表中是 10 月 7 日核对的 Google 图片输出单价,2.1 API 没有免费档。标准输入为每百万 token $1.50,文本与思考输出为每百万 token $7.50;可选搜索也可能增加费用。Batch 是异步批处理路径,上面的脚本没有启用它。
20 张标准 1K 图片的图片输出费用是 $0.672,20 张 4K 是 $2.26,还要加输入等费用。重做草稿和继续编辑可能产生新的请求。先设项目预算、确认草稿,再制作多个版本;其他平台的报价另算。
Hermes Agent 和 OpenClaw 怎样接入?
自部署 Hermes:已核对的 v2026.9.24 图片插件目录没有 Google 后端。可以让自定义 Skill 调用上方独立脚本,密钥放在进程环境里。Skill 接收参考图路径与编辑要求,运行脚本后返回输出文件路径。先手动验证一次,限定每个任务的调用次数,再交给智能体执行;不要把图片模型 ID 填成主聊天模型。
自部署 OpenClaw:已核对的 v2026.5.7 Google 图片适配器会把模型名称传给 generateContent。本文尚未测试它与 2.1 的兼容性,而 Google 当前为 2.1 提供的示例使用 Interactions。因此本文采用 Skill 调用独立脚本的路径;原生适配器需要用自己的密钥另做一次有限测试。
托管方式:两种框架共用 Image 选择界面,但运行插件不同。Hermes 的托管 Google 插件仍只接受旧模型 ID;填入 google/gemini-nano-banana-2.1 可能回落到旧默认模型。OpenClaw 可以接受自定义图片 ID,但这不能证明生成、编辑与计费都已验证。目前要明确使用 2.1,请走 AI Studio 或官方直连 API。
自部署需要自己维护环境、密钥、更新和排错;托管可以减少智能体运维,但不代表新图片模型自动可用。现有托管流程见 图片基础指南,其他供应商路径见 Hermes fal 指南、OpenClaw fal 指南。可比较 Hermes 托管 与 OpenClaw 托管。
请求失败时先查什么?
- 403:检查项目计费、API 权限与地区资格。
- 404:核对准确的模型 ID 和账户权限;旧 preview 名称指向另一个模型。
- 429:检查配额,采用有上限的退避重试,别让智能体无限循环。
- 没有图片:先检查响应及拒绝原因,不要把文字当图片保存。
- 实际跑了旧模型:查看真实请求中的模型名称和插件白名单,不能只看界面标签。
来源核对于 2026 年 10 月 7 日。框架说明依据上述版本及托管插件源码,不代表已逐一审计所有用户实例。
常见问题
Hermes Agent 能用 Nano Banana 2.1 吗?
自部署 Hermes 可以通过 Skill 调用你自己的 Google API 脚本。已核对的上游版本没有 Google 图片插件。托管 Google 插件仍只接受旧 ID,填入 2.1 会回落到旧默认模型,不能靠自定义 ID 开通。
OpenClaw 可以直接选择 2.1 吗?
Google 图片适配器接受模型名称,但本文没有测试它的 generateContent 路径与 2.1 是否兼容。下方采用 Google 为 2.1 提供的 Interactions 示例。界面接受 ID,不代表已经成功生成图片。
Nano Banana 2.1 免费吗?
该模型的 Gemini API 没有免费档。标准 1K 图片输出报价为每张 $0.0336,输入、文本与思考输出、可选搜索还可能收费。Gemini 应用额度与智能体托管订阅另算。
换背景能保证主体像素完全不变吗?
官方文档没有给出这样的保证。参考图能帮助维持一致性,但姿态、文字、细节、反光和位置关系仍可能改变。交付前要逐项对照原图。