内部团队参考

盈途 AI 网关图片生成模型使用指南

本指南只覆盖 VPS31 上已经接入 Yingtu AI Gateway 的图片生成/图片编辑模型,供运营、设计、产品图处理和自动化任务使用。

数据来源:VPS31 New API 数据库 更新时间:2026-07-05 当前模型数:23 默认令牌组:image

先看这里:日常不要纠结所有模型。产品局部改图优先用 gpt-image-2,但它通常是分钟级;普通高质量生成用 flux-2-pro;图片参考编辑用 flux-kontext-pro;快速试方向优先 flux-2-klein-9b、Gemini Flash Lite 或 Grok Lite;不懂模型时可以选 nano-banana 系列;中文电商风格图可试 wan2.7-image-pro

OpenAI GPT Image 最适合局部编辑、mask inpainting、产品图保留。需要“只换某个区域”时优先。
FLUX / Kontext 画面质感、摄影感、商品场景生成强。Kontext 更适合参考图编辑。
Gemini / Nano Banana 理解图片和复杂指令能力强。Nano Banana 是给非技术同事使用的友好别名。
Tongyi Wan / Grok Wan 适合中文语境和电商创意;Grok 更偏快速创意和风格化生成。

一、任务怎么选模型

任务 首选模型 备用模型 速度预期 使用建议
电商产品图局部替换,例如只换猫、不动碗 gpt-image-2 gpt-image-2-pro 慢:1-4 分钟 /v1/images/edits,必须提供 mask。mask 只覆盖要改的区域,不要盖住产品、文字和 logo。
用参考图改场景、换风格、重绘背景 flux-kontext-pro flux-kontext-max 快-中等:6-30 秒 Kontext 是 FLUX 的图片编辑方向。适合“照着原图改”,但不保证像 GPT Image + mask 那样锁定未选区域。
从文字直接生成高质量商品场景 flux-2-pro flux-2-max 中等:10-45 秒 pro 性价比高,max 适合更复杂、更讲究质感的首图。
快速出草图、批量试方向 flux-2-klein-9b grok-imagine-image-lite 很快:2-8 秒 先低价出方向,再把选中的提示词交给高质量模型重跑。
同事不熟悉模型,只想“生成/改图” nano-banana nano-banana-2-lite 快:2-15 秒 Nano Banana 是 Gemini 图像模型的友好名称,适合团队内部降低学习成本。
中文电商风格、中文理解、阿里生态模型 wan2.7-image wan2.7-image-pro 中等:10-60 秒 中文提示词可读性好,适合中国团队写中文创意需求。复杂画面用 pro。
创意风格图、社媒感、娱乐向视觉 grok-imagine-image grok-imagine-image-pro 很快-快:3-18 秒 适合快速找视觉方向,不建议用于要求产品外观 100% 一致的主图。

二、推荐给团队记住的 8 个模型

gpt-image-2

速度:慢,60-240 秒

产品图局部改图首选。需要 mask,适合“保留其它区域,只替换一个对象”。

flux-2-pro

速度:中等,10-25 秒

默认文生图模型。价格适中,质量稳定,适合大多数商品场景图。

flux-2-max

速度:偏慢,20-45 秒

更高质量版本。适合最终主图、复杂构图、需要更强质感的图。

flux-kontext-pro

速度:快,6-18 秒

默认参考图编辑模型。适合换背景、换场景、保留大致构图。

flux-kontext-max

速度:中等,10-30 秒

高质量参考图编辑。适合更难的改图,但成本比 pro 高。

nano-banana

速度:快,4-15 秒

团队友好名称。适合不了解 Gemini 背后模型的人直接使用。

nano-banana-pro

速度:中等偏慢,15-40 秒

高质量 Gemini 图像模型友好名。适合复杂理解、多元素图片任务。

wan2.7-image-pro

速度:偏慢,20-60 秒

通义万相高质量图像模型。适合中文电商需求和复杂中文提示词。

三、当前已接入模型清单

供应商/系列 模型 基础价/次 速度量级 端点 主要特点 推荐用途
OpenAI gpt-image-2 $0.100 60-240 秒 generation edit chat 局部编辑和 mask 能力最适合电商产品图,指令遵循较稳。 只换猫、换背景、保留产品不变。
OpenAI gpt-image-2-pro $0.100 60-240 秒 generation edit chat GPT Image 高质量路线。当前网关价格与普通版一致。 复杂产品图编辑、正式图候选。
OpenAI gpt-image-2-vip $0.100 45-180 秒 generation edit chat VIP 路由版本。对普通团队成员不必主动区分。 需要稳定路由时由技术人员指定。
Black Forest Labs flux-2-klein-9b $0.010 3-8 秒 generation edit chat 低价、速度快,适合先看方向。 批量试 prompt、草图、方向探索。
Black Forest Labs flux-2-pro $0.030 10-25 秒 generation edit chat FLUX.2 性价比主力,画面质感稳定。 默认文生图、商品场景图。
Black Forest Labs flux-2-max $0.070 20-45 秒 generation edit chat FLUX.2 高质量模型,复杂场景和质感更好。 最终主图、复杂商品场景。
Black Forest Labs flux-kontext-pro $0.035 6-18 秒 generation edit chat 参考图编辑性价比版本,适合改背景和改场景。 默认图生图/参考图编辑。
Black Forest Labs flux-kontext-max $0.070 10-30 秒 generation edit chat Kontext 高质量版本,细节和复杂编辑更稳。 正式改图候选、复杂参考图编辑。
Black Forest Labs flux-pro $0.040 5-15 秒 generation edit chat FLUX 旧版 Pro。保留作兼容和对比。 不作为默认推荐。
Google gemini-2.5-flash-image $0.176 4-15 秒 gemini chat Gemini 图像模型,理解图片和复杂文字指令较强。 多元素理解、参考图说明、轻量生成。
Google gemini-3.1-flash-lite-image $0.117 2-5 秒 gemini chat Gemini 轻量图像模型,成本较低。 快速生成、低成本任务。
Google gemini-3.1-flash-image $0.160 5-15 秒 gemini chat Gemini Flash 图像模型,速度和质量平衡。 通用生成、复杂提示词理解。
Google gemini-3-pro-image $0.240 15-40 秒 gemini chat Gemini Pro 图像模型,复杂语义和多元素任务更适合。 复杂图像任务、高质量候选。
Google nano-banana $0.039 4-15 秒 gemini Gemini 图像模型的前台友好名称,便于非技术同事使用。 日常快速生成/改图入口。
Google nano-banana-2-lite $0.039 2-5 秒 gemini Nano Banana 轻量版本。 低成本批量尝试。
Google nano-banana-2 $0.150 5-15 秒 gemini Nano Banana 新版本,质量和理解力更强。 日常高质量图像任务。
Google nano-banana-pro $0.240 15-40 秒 gemini Nano Banana 高质量版本,适合复杂语义和正式候选图。 复杂图片生成、参考图理解。
xAI grok-imagine-image-lite $0.009 2-5 秒 chat 低成本创意图像模型。 快速试方向,不建议用于精准产品图。
xAI grok-imagine-image $0.052 3-10 秒 chat 创意和风格化能力较强。 社媒风格图、创意方向。
xAI grok-imagine-image-edit $0.052 4-12 秒 chat 偏图片编辑入口。 创意改图、轻量编辑。
xAI grok-imagine-image-pro $0.075 6-18 秒 chat Grok Imagine 高质量版本。 创意正式候选图。
阿里巴巴 wan2.7-image $0.030 10-30 秒 generation edit 通义万相图像模型,中文提示词友好。 中文电商图、中文创意需求。
阿里巴巴 wan2.7-image-pro $0.080 20-60 秒 generation edit 通义万相高质量版本,复杂任务更稳。 正式中文商品图、复杂中文提示词。

四、怎么在 Hermes / API 中写清楚

接口类型 适用模型 怎么写给 Hermes
/v1/images/edits GPT Image、FLUX、Wan 明确写“使用某模型,通过 /v1/images/edits 执行图片编辑”。如果要局部改图,附上 mask,并说明 mask 只覆盖要改区域。
/v1/images/generations GPT Image、FLUX、Wan 明确写“文生图”或“用参考图生成”。FLUX 多参考图编辑通常更适合在 generation 请求里带参考图字段。
/v1beta/models/{model}:generateContent Gemini、Nano Banana 明确写“使用 Gemini native endpoint”。图片输入作为 contents.parts 传入。
/v1/chat/completions Grok、部分 Gemini、部分 FLUX 适合聊天式图片输出。若任务要求严格局部编辑,不建议优先使用 chat completions。

五、团队可直接复制的任务模板

产品图局部替换

适合只替换猫、人物、背景局部,不动产品。

请使用 gpt-image-2,通过 /v1/images/edits 编辑图片。
只修改 mask 覆盖区域,保持产品、logo、文字、背景构图不变。
任务:把右侧原猫替换成小缅因猫幼猫。
要求:碗、猫粮、品牌字样、顶部标题必须保持原样。

商品场景图生成

适合从零生成高质量电商场景。

请使用 flux-2-pro 生成电商产品场景图。
画面风格:真实摄影、自然光、干净背景、适合 Amazon 主图/副图。
产品必须清晰居中,避免变形,不要添加无关文字。

参考图改场景

适合保留主体并换环境或换风格。

请使用 flux-kontext-pro,根据参考图做图片编辑。
保留主体结构和产品外观,替换为更高级的室内宠物用品场景。
不要改变产品颜色、logo、比例和关键细节。

非技术同事快速生成

适合不知道模型差异时。

请使用 nano-banana 生成图片。
根据以下中文描述生成一张适合电商详情页的图片:
画面干净、明亮、真实,产品突出,避免夸张变形。

中文电商创意

适合中文提示词、中文场景和国内模型偏好。

请使用 wan2.7-image-pro 生成中文电商风格图片。
要求:真实摄影感,适合宠物用品详情页,画面温暖、干净、有生活感。

低成本试方向

适合批量测试多个创意。

请使用 flux-2-klein-9b 快速生成 4 个方向草图。
只看构图和创意,不需要最终精修。选中方向后再用 flux-2-pro 重跑。

六、产品图注意事项

七、速度参考与超时建议

图片生成没有稳定 SLA,耗时会受到尺寸、质量、参考图数量、是否编辑、上游排队和网络下载影响。 网关主要是路由转发,通常不是瓶颈;用户体感耗时基本等于上游生成时间加少量网络开销。

极快:2-5 秒

适合快速预览、低成本试方向和多轮 prompt 调整。

快:4-18 秒

适合日常生成,质量和响应速度比较均衡。

中等:15-45 秒

适合更高质量、复杂提示词、参考图编辑或一致性要求。

慢:1-4 分钟

主要是高质量 GPT Image 系列,建议异步化或放宽超时。

需要严格评估时,建议在网关侧用同一尺寸、同一模型、同一请求参数实测 20-50 次,记录 P50/P90 后再决定默认模型和接口超时。

速度口径参考:本地网关模型清单、Artificial Analysis Image Models 的 API Generation Time 指标,以及 BFL、Google、OpenAI/API 聚合供应商公开说明。这里给的是团队选型量级,不等同于供应商 SLA。