GPT Image 2 API 实战:从文生图到图像编辑
DALL·E 退场后的官方图像 API。本文讲清 GPT Image 2 的生成与编辑调用、b64 输出的落盘处理、quality 等参数,以及从 ChatGPT 内生成到 API 的分工。
操作步骤
写好 prompt 并调用 generate
client.images.generate(model="gpt-image-2", prompt=…)——prompt 越具体(主体、风格、构图、光照)越稳。
解码 base64 并落盘
从 result.data[0].b64_json 取出编码,base64.b64decode(Python)或 Buffer.from(Node)解码后写入 PNG 文件。
按需加参数
quality 控制质量档位;批量场景先用低质量验证 prompt,再高质量出片。
编辑已有图用 edit
images.edit 传入原图与编辑指令,适合局部修改与基于已有图的变体;同样返回 b64_json。
GPT Image 2 API 是 OpenAI 的图像生成与编辑接口:以自然语言 prompt 驱动,生成或编辑图像,以 base64 形式返回。随着 DALL·E 全面退场——API 模型 2026-05-12 下线、ChatGPT 内的 DALL·E GPT 2026-08-30 退役——GPT Image 2 成为 OpenAI 图像生成的唯一承接者。本教程给出 Python 与 Node 双语言的生成、落盘与编辑示例,代码逐行对照官方 Image generation 指南。
说明:本文代码对照官方指南核对(文档核对版),
lastTestedAt为核对日期;参数取值以官方指南为准。
1. 生成第一张图(Python)
官方指南的 Python 示例形状如下——model 显式指定 gpt-image-2,返回从 result.data[0].b64_json 取出后解码落盘:
import base64
from openai import OpenAI
client = OpenAI()
prompt = "一只水彩风格的水獭,坐在图书馆里看书,暖光"
result = client.images.generate(
model="gpt-image-2",
prompt=prompt,
)
image_base64 = result.data[0].b64_json
image_bytes = base64.b64decode(image_base64)
with open("otter.png", "wb") as f:
f.write(image_bytes)
三个关键点:model="gpt-image-2" 必须显式写;prompt 是唯一必填的创意输入;返回值在 data[0].b64_json——是编码字符串,不是二进制,直接写文件会得到损坏的图片。
2. Node.js 等价写法
import fs from "fs";
import OpenAI from "openai";
const client = new OpenAI();
const prompt = "A watercolor otter reading in a library, warm light";
const result = await client.images.generate({
model: "gpt-image-2",
prompt,
});
const image_base64 = result.data[0].b64_json;
const image_bytes = Buffer.from(image_base64, "base64");
fs.writeFileSync("otter.png", image_bytes);
3. 图像编辑:images.edit
编辑走 images.edit,与生成的差别是要传入原图:
const response = await client.images.edit({
model: "gpt-image-2",
image: images, // 要编辑的原图
prompt, // 编辑指令,例如 "把背景换成雪夜,保持主体不变"
});
const image_base64 = response.data[0].b64_json;
典型场景:局部修改("把背景换成雪夜")、基于产品图的变体、保持主体的一致性改写。编辑的质量很大程度上取决于指令是否明确"改什么、保留什么"。
4. 参数:质量
官方指南中的常用参数:
- quality:质量档位(示例中出现
"high"/"low")。批量流水线建议两段式——低质量快速出小样、人工筛选后高质量重绘,成本差一目了然。
参数组合以官方指南为准;不要凭旧 DALL·E 时代的记忆猜参数名——两代 API 的参数面并不相同。
5. API 与 ChatGPT 内生成怎么分工
本周(2026-08-30)ChatGPT 内的官方 DALL·E GPT 已如期退役,ChatGPT Images 成为产品侧入口。两条路的分工:
| 维度 | ChatGPT 内(ChatGPT Images) | API(GPT Image 2) |
|---|---|---|
| 交互 | 对话式迭代,适合人工挑选 | 程序化调用,适合批量 |
| 自动化 | 无(手动操作) | 完全可编排 |
| 成本 | 订阅额度内 | 按 token / 张计费 |
| 下游处理 | 手动导出 | 直接进管线(base64 即文件) |
两者底层同为 GPT Image 2,prompt 写法互通——在 ChatGPT 里调好的 prompt 可以直接搬进 API。
常见问题
1. GPT Image 2 和 DALL·E 什么关系?
替代关系。DALL·E 2/3 的 API 模型已于 2026-05-12 硬下线,ChatGPT 内的官方 DALL·E GPT 也在 2026-08-30 退役。现在无论产品侧还是 API 侧,OpenAI 的图像生成都由 GPT Image 2 承接——旧代码里把 model 参数从 dall-e-3 改成 gpt-image-2 是迁移的第一步。
2. 返回的 base64 怎么处理?
响应里 result.data[0].b64_json 是图像的 base64 编码。Python 用 base64.b64decode 解码后以二进制写文件;Node 用 Buffer.from(image_base64, "base64") 后 fs.writeFileSync。官方指南的两个示例分别演示了这两种落盘方式。
3. 图像编辑怎么调用?
用 images.edit:传入 model(gpt-image-2)、image(要编辑的原图)和 prompt(编辑指令),返回值同样是 b64_json。适合局部修改、风格迁移、基于已有图的变体生成等场景。
4. quality 参数有什么用?
quality 控制生成质量档位(如 "high" / "low"),质量越高成本越高——批量场景可以先用低质量 draft、精选后高质量重绘;其余参数的取值以官方指南为准。
5. 应该用 API 还是 ChatGPT 内生成?
按工作流分工:交互式、单张、需要反复对话调整的创作用 ChatGPT 内的 ChatGPT Images;程序化、批量、要进产品的生成用 API。两者底层同为 GPT Image 2,prompt 写法互通。
6. 生成结果可以直接进生产吗?
技术上进得去(拿到 base64 就是普通文件),但内容层面建议保留人工审核或内容过滤环节——生成模型对 prompt 的还原度随 prompt 质量波动,批量场景先小样本验证 prompt 的稳定性,再放量。
下一步
- 三大图像模型的横向对比?读 《GPT Image 2 vs Midjourney vs DALL·E 3:三大图像生成模型实战对比(2026)》。
- prompt 写法与风格控制?读 《GPT Image 系列 完全指南:从文生图到图像编辑、风格控制》。
- 本周 DALL·E GPT 退役的完整背景?读 《OpenAI 生态第 41 周速报(2026-08-28 至 2026-08-29):终止向 Cursor 供模 / 多 Google 账号 / DALL·E GPT 退役倒计时》。
关键要点
- 生成:client.images.generate(model="gpt-image-2", prompt=…)——model 必须显式指定为 gpt-image-2
- 返回是 base64:result.data[0].b64_json,用 base64.b64decode(Python)或 Buffer.from(Node)落盘
- 编辑:images.edit({ model: "gpt-image-2", image: 原图, prompt: 编辑指令 })——传原图 + 指令
- quality(如 "high" / "low")等参数控制输出;质量越高成本越高
- DALL·E 已全面退场:API 模型 2026-05-12 下线,ChatGPT 内的 DALL·E GPT 2026-08-30 退役——新项目只有 GPT Image 2
- 分工建议:交互式创作用 ChatGPT 内的 ChatGPT Images,程序化批量用 API
常见问题
官方参考
相关文章
GPT Image 2 vs Midjourney vs DALL·E 3:三大图像生成模型实战对比(2026)
GPT Image 2 / Midjourney / DALL·E 3 三大图像生成模型实战对比:图像质量 / 文字渲染 / 一致性 / 价格 / 商业版权。文末给选型决策表 + 企业混合工作流。
阅读全文GPT Image 2 品牌视觉实战:电商主图、Logo 迭代与版权边界
GPT Image 2 在品牌视觉场景的实战:电商主图一致性、Logo 多版本迭代、品牌色彩控制、版权与商用边界(含安全使用清单)。
阅读全文GPT Image 2 提示词公式与商业使用边界
GPT Image 2 是当前主推的图像模型(DALL·E 2/3 已下线)。本文给出 5 段式提示词公式、风格控制(natural / vivid)、尺寸质量参数、商业使用前的 Usage Policy 自查清单。
阅读全文订阅 GPTMap Weekly
每周一封邮件,精选 OpenAI 重要更新、深度解读与最佳实践。无广告,可随时退订。