内部团队参考
盈途 AI 网关图片生成模型使用指南
本指南只覆盖 VPS31 上已经接入 Yingtu AI Gateway 的图片生成/图片编辑模型,供运营、设计、产品图处理和自动化任务使用。
先看这里:日常不要纠结所有模型。产品局部改图优先用 gpt-image-2,但它通常是分钟级;普通高质量生成用 flux-2-pro;图片参考编辑用 flux-kontext-pro;快速试方向优先 flux-2-klein-9b、Gemini Flash Lite 或 Grok Lite;不懂模型时可以选 nano-banana 系列;中文电商风格图可试 wan2.7-image-pro。
一、任务怎么选模型
| 任务 | 首选模型 | 备用模型 | 速度预期 | 使用建议 |
|---|---|---|---|---|
| 电商产品图局部替换,例如只换猫、不动碗 | gpt-image-2 |
gpt-image-2-pro |
慢:1-4 分钟 | 走 /v1/images/edits,必须提供 mask。mask 只覆盖要改的区域,不要盖住产品、文字和 logo。 |
| 用参考图改场景、换风格、重绘背景 | flux-kontext-pro |
flux-kontext-max |
快-中等:6-30 秒 | Kontext 是 FLUX 的图片编辑方向。适合“照着原图改”,但不保证像 GPT Image + mask 那样锁定未选区域。 |
| 从文字直接生成高质量商品场景 | flux-2-pro |
flux-2-max |
中等:10-45 秒 | pro 性价比高,max 适合更复杂、更讲究质感的首图。 |
| 快速出草图、批量试方向 | flux-2-klein-9b |
grok-imagine-image-lite |
很快:2-8 秒 | 先低价出方向,再把选中的提示词交给高质量模型重跑。 |
| 同事不熟悉模型,只想“生成/改图” | nano-banana |
nano-banana-2-lite |
快:2-15 秒 | Nano Banana 是 Gemini 图像模型的友好名称,适合团队内部降低学习成本。 |
| 中文电商风格、中文理解、阿里生态模型 | wan2.7-image |
wan2.7-image-pro |
中等:10-60 秒 | 中文提示词可读性好,适合中国团队写中文创意需求。复杂画面用 pro。 |
| 创意风格图、社媒感、娱乐向视觉 | grok-imagine-image |
grok-imagine-image-pro |
很快-快:3-18 秒 | 适合快速找视觉方向,不建议用于要求产品外观 100% 一致的主图。 |
二、推荐给团队记住的 8 个模型
gpt-image-2
速度:慢,60-240 秒
产品图局部改图首选。需要 mask,适合“保留其它区域,只替换一个对象”。
flux-2-pro
速度:中等,10-25 秒
默认文生图模型。价格适中,质量稳定,适合大多数商品场景图。
flux-2-max
速度:偏慢,20-45 秒
更高质量版本。适合最终主图、复杂构图、需要更强质感的图。
flux-kontext-pro
速度:快,6-18 秒
默认参考图编辑模型。适合换背景、换场景、保留大致构图。
flux-kontext-max
速度:中等,10-30 秒
高质量参考图编辑。适合更难的改图,但成本比 pro 高。
nano-banana
速度:快,4-15 秒
团队友好名称。适合不了解 Gemini 背后模型的人直接使用。
nano-banana-pro
速度:中等偏慢,15-40 秒
高质量 Gemini 图像模型友好名。适合复杂理解、多元素图片任务。
wan2.7-image-pro
速度:偏慢,20-60 秒
通义万相高质量图像模型。适合中文电商需求和复杂中文提示词。
三、当前已接入模型清单
| 供应商/系列 | 模型 | 基础价/次 | 速度量级 | 端点 | 主要特点 | 推荐用途 |
|---|---|---|---|---|---|---|
| OpenAI | gpt-image-2 | $0.100 | 60-240 秒 | generation edit chat | 局部编辑和 mask 能力最适合电商产品图,指令遵循较稳。 | 只换猫、换背景、保留产品不变。 |
| OpenAI | gpt-image-2-pro | $0.100 | 60-240 秒 | generation edit chat | GPT Image 高质量路线。当前网关价格与普通版一致。 | 复杂产品图编辑、正式图候选。 |
| OpenAI | gpt-image-2-vip | $0.100 | 45-180 秒 | generation edit chat | VIP 路由版本。对普通团队成员不必主动区分。 | 需要稳定路由时由技术人员指定。 |
| Black Forest Labs | flux-2-klein-9b | $0.010 | 3-8 秒 | generation edit chat | 低价、速度快,适合先看方向。 | 批量试 prompt、草图、方向探索。 |
| Black Forest Labs | flux-2-pro | $0.030 | 10-25 秒 | generation edit chat | FLUX.2 性价比主力,画面质感稳定。 | 默认文生图、商品场景图。 |
| Black Forest Labs | flux-2-max | $0.070 | 20-45 秒 | generation edit chat | FLUX.2 高质量模型,复杂场景和质感更好。 | 最终主图、复杂商品场景。 |
| Black Forest Labs | flux-kontext-pro | $0.035 | 6-18 秒 | generation edit chat | 参考图编辑性价比版本,适合改背景和改场景。 | 默认图生图/参考图编辑。 |
| Black Forest Labs | flux-kontext-max | $0.070 | 10-30 秒 | generation edit chat | Kontext 高质量版本,细节和复杂编辑更稳。 | 正式改图候选、复杂参考图编辑。 |
| Black Forest Labs | flux-pro | $0.040 | 5-15 秒 | generation edit chat | FLUX 旧版 Pro。保留作兼容和对比。 | 不作为默认推荐。 |
| gemini-2.5-flash-image | $0.176 | 4-15 秒 | gemini chat | Gemini 图像模型,理解图片和复杂文字指令较强。 | 多元素理解、参考图说明、轻量生成。 | |
| gemini-3.1-flash-lite-image | $0.117 | 2-5 秒 | gemini chat | Gemini 轻量图像模型,成本较低。 | 快速生成、低成本任务。 | |
| gemini-3.1-flash-image | $0.160 | 5-15 秒 | gemini chat | Gemini Flash 图像模型,速度和质量平衡。 | 通用生成、复杂提示词理解。 | |
| gemini-3-pro-image | $0.240 | 15-40 秒 | gemini chat | Gemini Pro 图像模型,复杂语义和多元素任务更适合。 | 复杂图像任务、高质量候选。 | |
| nano-banana | $0.039 | 4-15 秒 | gemini | Gemini 图像模型的前台友好名称,便于非技术同事使用。 | 日常快速生成/改图入口。 | |
| nano-banana-2-lite | $0.039 | 2-5 秒 | gemini | Nano Banana 轻量版本。 | 低成本批量尝试。 | |
| nano-banana-2 | $0.150 | 5-15 秒 | gemini | Nano Banana 新版本,质量和理解力更强。 | 日常高质量图像任务。 | |
| nano-banana-pro | $0.240 | 15-40 秒 | gemini | Nano Banana 高质量版本,适合复杂语义和正式候选图。 | 复杂图片生成、参考图理解。 | |
| xAI | grok-imagine-image-lite | $0.009 | 2-5 秒 | chat | 低成本创意图像模型。 | 快速试方向,不建议用于精准产品图。 |
| xAI | grok-imagine-image | $0.052 | 3-10 秒 | chat | 创意和风格化能力较强。 | 社媒风格图、创意方向。 |
| xAI | grok-imagine-image-edit | $0.052 | 4-12 秒 | chat | 偏图片编辑入口。 | 创意改图、轻量编辑。 |
| xAI | grok-imagine-image-pro | $0.075 | 6-18 秒 | chat | Grok Imagine 高质量版本。 | 创意正式候选图。 |
| 阿里巴巴 | wan2.7-image | $0.030 | 10-30 秒 | generation edit | 通义万相图像模型,中文提示词友好。 | 中文电商图、中文创意需求。 |
| 阿里巴巴 | wan2.7-image-pro | $0.080 | 20-60 秒 | generation edit | 通义万相高质量版本,复杂任务更稳。 | 正式中文商品图、复杂中文提示词。 |
四、怎么在 Hermes / API 中写清楚
| 接口类型 | 适用模型 | 怎么写给 Hermes |
|---|---|---|
/v1/images/edits |
GPT Image、FLUX、Wan | 明确写“使用某模型,通过 /v1/images/edits 执行图片编辑”。如果要局部改图,附上 mask,并说明 mask 只覆盖要改区域。 |
/v1/images/generations |
GPT Image、FLUX、Wan | 明确写“文生图”或“用参考图生成”。FLUX 多参考图编辑通常更适合在 generation 请求里带参考图字段。 |
/v1beta/models/{model}:generateContent |
Gemini、Nano Banana | 明确写“使用 Gemini native endpoint”。图片输入作为 contents.parts 传入。 |
/v1/chat/completions |
Grok、部分 Gemini、部分 FLUX | 适合聊天式图片输出。若任务要求严格局部编辑,不建议优先使用 chat completions。 |
五、团队可直接复制的任务模板
产品图局部替换
适合只替换猫、人物、背景局部,不动产品。
请使用 gpt-image-2,通过 /v1/images/edits 编辑图片。
只修改 mask 覆盖区域,保持产品、logo、文字、背景构图不变。
任务:把右侧原猫替换成小缅因猫幼猫。
要求:碗、猫粮、品牌字样、顶部标题必须保持原样。
商品场景图生成
适合从零生成高质量电商场景。
请使用 flux-2-pro 生成电商产品场景图。
画面风格:真实摄影、自然光、干净背景、适合 Amazon 主图/副图。
产品必须清晰居中,避免变形,不要添加无关文字。
参考图改场景
适合保留主体并换环境或换风格。
请使用 flux-kontext-pro,根据参考图做图片编辑。
保留主体结构和产品外观,替换为更高级的室内宠物用品场景。
不要改变产品颜色、logo、比例和关键细节。
非技术同事快速生成
适合不知道模型差异时。
请使用 nano-banana 生成图片。
根据以下中文描述生成一张适合电商详情页的图片:
画面干净、明亮、真实,产品突出,避免夸张变形。
中文电商创意
适合中文提示词、中文场景和国内模型偏好。
请使用 wan2.7-image-pro 生成中文电商风格图片。
要求:真实摄影感,适合宠物用品详情页,画面温暖、干净、有生活感。
低成本试方向
适合批量测试多个创意。
请使用 flux-2-klein-9b 快速生成 4 个方向草图。
只看构图和创意,不需要最终精修。选中方向后再用 flux-2-pro 重跑。
六、产品图注意事项
- 电商产品图最重要的是产品一致性。需要保持碗、包装、logo、颜色完全不变时,优先使用
gpt-image-2 + mask,或者 AI 出背景后再人工合成产品。 - 不要只写“换成小缅因猫”。要同时写清楚“不要改碗、不要改文字、不要改 logo、不要改构图”。
- FLUX 和 Gemini 的图片编辑能力强,但未必像 mask inpainting 一样严格锁定未编辑区域。
- 正式出图建议流程:低价模型试方向 → 高质量模型重跑 → 人工检查产品细节 → 必要时 Photoshop/GIMP 合成。
- 上表价格是网关配置的基础价/次;前台实际展示可能会叠加令牌组倍率,例如 image 组倍率。
七、速度参考与超时建议
图片生成没有稳定 SLA,耗时会受到尺寸、质量、参考图数量、是否编辑、上游排队和网络下载影响。 网关主要是路由转发,通常不是瓶颈;用户体感耗时基本等于上游生成时间加少量网络开销。
适合快速预览、低成本试方向和多轮 prompt 调整。
适合日常生成,质量和响应速度比较均衡。
适合更高质量、复杂提示词、参考图编辑或一致性要求。
主要是高质量 GPT Image 系列,建议异步化或放宽超时。
需要严格评估时,建议在网关侧用同一尺寸、同一模型、同一请求参数实测 20-50 次,记录 P50/P90 后再决定默认模型和接口超时。
速度口径参考:本地网关模型清单、Artificial Analysis Image Models 的 API Generation Time 指标,以及 BFL、Google、OpenAI/API 聚合供应商公开说明。这里给的是团队选型量级,不等同于供应商 SLA。