🎯 一句话总结:不要把 GPT-Image 2.5 当成“输入一句话就交付”的黑盒;先做一张能验收的基准图,再用单变量编辑、职责明确的参考图和文件检查,把结果推进到可用状态。

GPT-Image 2.5 从提示词到可交付图片的工作流封面

很多生图失败,并不是提示词太短,而是任务没有被拆开:第一张图还没确认,就开始改颜色;参考图没有分工,就要求模型“融合”;聊天窗口看着像透明背景,下载后却是完全不透明的 PNG。

这篇文章用一个俯拍阅读桌贯穿示例,完成四个小闭环:生成基准图、做单变量编辑、分配多张参考图职责、验收透明 PNG。每一步都写清输入、输出和回退条件。

📌 先确认模型、入口和验收标准

OpenAI 当前开发者文档将 GPT Image 2.5 分为两个模型:GPT-Image 2.5 Flare 偏速度,GPT-Image 2.5 Sunburst 偏质量。具体模型名、参数和价格会更新,接入前应以官方文档为准:

本文使用本地 OpenAI 兼容接口 http://127.0.0.1:8081/v1/images/generations 做实际生成测试,模型名为 gpt-image-2.5。这只是当前本地网关的路由名,不等同于官方 API 文档中的 Flare 或 Sunburst 名称;换到官方 API 时,应改成接口实际支持的模型 ID。

开始前记录五件事:

  1. 使用聊天界面还是 API;
  2. 实际请求的模型名;
  3. 画幅、尺寸、质量和输出格式;
  4. 是否使用参考图或编辑接口;
  5. 什么条件算通过,什么情况必须回退。

不要用一张生成结果反推后台模型。API 以请求参数和返回结果为准。

🧾 第一步:先做一张可数清楚的基准图

第一张图的目标不是“惊艳”,而是给后续编辑提供稳定起点。制作单要写对象、位置、视角和禁止项。

本例的制作单:

  • 画幅:16:9;
  • 视角:正上方俯拍;
  • 中央:一本打开的书;
  • 左侧:一盏深绿色台灯;
  • 右侧:一个白色马克杯;
  • 左下:一支黑色钢笔;
  • 右上:一盆小型仙人掌;
  • 背景:浅色木桌;
  • 禁止:人物、额外文具、可读文字、品牌 Logo。

基准图制作单与结果的对应关系

可复制提示词

生成一张 16:9 写实商业摄影风格的俯拍阅读桌。

浅色木桌中央放一本打开的书;深绿色台灯位于左侧;白色马克杯位于右侧;黑色钢笔位于左下角;小型仙人掌位于右上角。

保持物件彼此分离,位置清楚,光线柔和自然。不要添加其他物品,不要出现人物、可读文字或品牌 Logo。主体不要贴近画面边缘,为后续编辑保留安全空间。

先数东西,再评价风格

按这个顺序验收:

  1. 五组指定物件是否都出现,数量是否正确;
  2. 物件左右位置是否正确;
  3. 有没有手、餐具、额外文具或随机文字;
  4. 主体是否被裁切,边缘是否留出编辑空间;
  5. 光线、材质和视角是否达到下一步要求。

多个基础条件同时失败,就重做基准图。只有一个局部出错,才进入编辑。

🔧 第二步:每轮只改一个主要变量

连续编辑最怕“顺便再改几处”。一次只改变一个主要变量,才能知道结果来自哪里。下面三轮都从上一张合格图继续。

只改颜色

继续编辑上一张图。

只把左侧深绿色台灯改成哑光黑色。台灯的位置、大小、角度和光照保持不变。

打开的书、白色马克杯、黑色钢笔、仙人掌、桌面纹理、构图和视角全部保持不变。

检查:台灯颜色改变,其他物件数量和位置没有影响用途的变化。

只删除一个物体

继续编辑上一张图。

只删除左下角的黑色钢笔,不要用其他物体填补空位。

保留上一轮的哑光黑台灯。书、马克杯、仙人掌、桌面、构图、光线和视角保持不变。

检查:钢笔消失,原位置留下自然空白;台灯仍是哑光黑色。

只替换一个物体

继续编辑上一张图。

只把右上角的仙人掌替换成一只透明玻璃花瓶,花瓶里放两枝黄色郁金香。新物体占用面积与原仙人掌接近。

保留前两轮结果:台灯仍为哑光黑色,左下角钢笔仍被删除。其他内容保持不变。

检查:替换发生,前两轮修改没有回退,书、杯子和主要构图没有明显漂移。

单变量编辑:颜色、删除和替换三个独立步骤

“保持不变”不代表逐像素锁定。生成式编辑可能重绘木纹、阴影、边缘和小纹理。只要这些变化不影响用途,可以记录为模型边界;如果主体结构、文字或布局变了,就回到最后一张合格图,缩小当前修改范围。

🧩 第三步:让每张参考图只负责一件事

“把这三张图融合一下”不是可检查的任务。更稳的做法是给参考图分配权限,并写出冲突时的优先级:

  • 产品图:负责形状、材质、标签、颜色和产品文字;
  • 氛围图:负责光线、色调、阴影和整体质感;
  • 构图图:负责位置、比例和留白。

优先级可以写成:产品真实性 > 构图关系 > 氛围效果。氛围图里的道具、Logo 和第二个产品默认不复制。

多参考图职责分配:产品、氛围和构图各自控制不同变量

可复制提示词

图1只负责产品本身;图2只负责光线与色彩;图3只负责构图与留白。
优先级:图1产品结构与标签 > 图3位置与比例 > 图2氛围。

使用图1中的同一产品,完整放在画面左侧,右侧保留干净留白。
保持产品形状、比例、标签位置和文字不变,只加入符合物理规律的反射与接触阴影。
不要复制图2和图3中的物体、文字、Logo、道具或第二个产品。

这一轮只验收三件事:产品数量和主要结构、构图图的左右关系、氛围图中的无关物体是否被误复制。参考图冲突时,宁可牺牲部分氛围,也不要牺牲产品真实性。

🗺️ 第四步:用草图控制布局,不把它当尺寸证明

草图适合表达“东西放在哪里”,不适合替代 CAD、3D 或确定性排版软件。草图里只保留主要几何关系,例如中央矩形代表书桌,左侧竖矩形代表窗户,桌后椭圆代表椅子,右侧细长矩形代表落地灯,下方圆形代表地毯。

可复制提示词

严格沿用参考草图中的主要空间布局,生成一张 16:9 写实现代书房效果图。

中央矩形变成胡桃木书桌,左侧竖矩形变成大窗,桌后椭圆变成棕色皮椅,右侧细长矩形变成黑色落地灯,下方圆形变成米白色圆形地毯。

保留各物体的位置、大小关系和主要留白。不要交换左右关系,不要增加第二张桌子,不要改变相机视角。

先检查五个主要物体是否都在,再检查左右和遮挡关系,最后评价材质。桌子、椅子和灯全部错位时,回到草图增加方向标记,不要继续堆形容词。

🧪 第五步:把透明背景当成文件问题验收

聊天窗口里的棋盘格只是预览效果。真正的透明 PNG 至少要检查三层:文件格式、Alpha 通道和边缘。

透明 PNG 文件验收:格式、Alpha 通道和黑白背景边缘检查

可复制提示词

生成一只完整的复古金属台灯,三分之四侧视角,商品摄影风格,边缘清晰。

输出为带真实 Alpha 通道的透明背景 PNG。不要白色或灰色背景,不要绘制棋盘格,不要地面底板,不要裁切主体。

API 的输出格式和透明背景字段要以当前官方指南和 SDK 版本为准。提示词写了“透明”,不等于文件一定有可用 Alpha。官方图像提示文档明确建议在需要透明输出时显式设置 transparent,并使用 PNG 或 WebP;具体参数仍应以当前接口为准。

Pillow 检查脚本

from PIL import Image

image = Image.open("product.png")
print("mode:", image.mode)
print("has_alpha:", "A" in image.getbands())

if "A" in image.getbands():
    alpha = image.getchannel("A")
    print("alpha_range:", alpha.getextrema())

has_alpha=True 只代表文件有 Alpha 通道。如果 alpha_range(255, 255),整张图仍完全不透明。出现小于 255 的值,才说明存在透明或半透明像素。最后把图片放到黑、白背景上检查白边、黑边和残留棋盘格。

✍️ 第六步:文字和信息图必须逐字检查

短标题和少量标签可以用来测试模型的文字能力;长段落、复杂表格和必须逐字准确的包装文案,应交给确定性排版工具。

可以先生成一个只有一个标题、三个步骤和三个图标的信息图,再只提交一个文字修改:

只把右下角数据卡片中的“容量 500 ml”改成“容量 600 ml”。

其他中文、数字、图标、箭头、颜色、尺寸和排版全部保持不变。

检查目标文字、其他数字、中文字符、图标数量、箭头方向、间距和背景重绘。关键字错一个,就不要把图片直接发布。

🧯 失败时如何回退

编辑后上一轮结果消失

回到最后一张合格图,只重新提交当前修改,并再次写出必须保留的结果。

只改一个物体,整张图都变了

先判断是否影响用途。主体结构、文字或布局发生变化,就回退并缩小修改范围;需要像素级锁定时,换用确定性设计软件。

多参考图互相污染

重写每张图的职责、优先级和禁止复制清单。必要时把构图参考图处理成只剩几何关系的草图。

透明图有底色或脏边

不要继续碰运气地加提示词。先确认导出格式,再用 Pillow 检查 Alpha,最后在黑白背景上查看边缘。

最终完成标准

  • 入口、模型、尺寸、质量设置、输入图和提示词已经记录;
  • 基准图的数量、位置、构图和禁止项全部通过;
  • 每轮只修改一个主要变量,并保留上一张合格图;
  • 多参考图写明职责、优先级和禁止复制清单;
  • 草图的空间关系保留,但没有把它当成精确尺寸证明;
  • 透明 PNG 检查了格式、Alpha、透明像素和黑白背景边缘;
  • 信息图的文字、数字、图标和箭头逐项复核;
  • 品牌、包装、印刷和像素级修改任务转入确定性工具;
  • 提示词、输入图、各轮结果和最终文件保存在同一项目目录。

GPT-Image 2.5 的价值不在于一条提示词永远成功,而在于它能不能进入一个可观察、可回退的工作流。把任务拆小,把每轮修改限制在一个变量内,把预览和文件验收分开,你才知道一张图是“看起来不错”,还是已经可以交付。

参考资料: GPT-Image 2.5 FlareGPT-Image 2.5 SunburstOpenAI Image generation 指南OpenAI Image prompting 指南OpenAI API Pricing