概述
gpt-image-2 是 OpenAI 最新旗舰图像生成模型,是gpt-image-1.5 的升级版。核心升级:任意合法分辨率(含 2K / 3840×2160 4K)、参考图自动高保真、同档降价 20-30%。API易 网关完整兼容 OpenAI Images API,OpenAI 官方 SDK 把 base_url 指过来即可零代码改动直连。
文生图 API
/v1/images/generations,输入文本提示词生成图片,支持 size / quality / output_format。图片编辑 API
/v1/images/edits,multipart 上传参考图(最多 16 张)+ 编辑/融合指令,支持 mask 局部重绘。为什么选 API易 的 GPT-image-2 官转?
对标 OpenAI 官方通道,针对企业生产场景在 稳定性、成本、接入体验 三方面做了深度优化:官方通道 · 与官方一致
不限并发 · 企业可放量
同价 + 充值最低 85 折
全球零门槛接入
api.apiyi.com,延迟稳定、免去出海改造。模型生态齐全
gpt-image-2-all($0.03/张统一价)可无缝切换,另有性价比标杆 Nano Banana Pro / 2,按场景自由组合。专业服务 · 企业陪跑
核心特性
任意分辨率(含 4K)
参考图自动高保真
input_fidelity。同档降价 20-30%
中文 + 文字渲染
high 档位下精细文字几乎不糊。多图融合(最多 16 张)
image[] 数组最多接受 16 张参考图,prompt 中可用「图1/图2/图3」明确指代。mask 局部重绘
多种输出格式
output_compression 控制体积。OpenAI SDK 直连
base_url 指向 https://api.apiyi.com/v1 即可用 OpenAI 官方 SDK 直接调用,零代码改动迁移。模型定价
API易gpt-image-2(Default 分组)单价与 OpenAI 官网完全一致,折扣体现在充值活动上——充值 100 美金即送 10%,最多可送 20%,📖 了解充值活动。
按 token 计费单价(与官网一致)
按 token 计费,一次请求 = 文本输入 + 图片输入 + 图片输出三段 token 之和:每张成本速查(官方按量定价表)
1K 预设尺寸下,每张输出图的典型成本:- 单价与 OpenAI 官网一致,叠加 充值加赠(充 $100 送 10%,最高 20%)后实际成本低于官方直连
- 2K / 4K 无固定每张价,按输入 + 输出 token 实计
- 编辑场景因强制高保真,输入 token 明显高于纯文生图
- 流式出图(
stream: true+partial_images: N)每张 partial 额外消耗 100 个输出 image token - 对比
gpt-image-1.5,同档同尺寸gpt-image-2成本低约 20-30%
多图输入的价格影响(2026-07 实测)
客户常问:「参考图是每张定量收费,还是图片越大消耗越多?」答案是两者都影响,且张数严格线性累加。gpt-image-2 对输入图固定高保真处理(input_fidelity 不可调,传了直接 400),每张参考图按尺寸/宽高比换算成 image token。以下为控制变量实测(编辑接口,2026-07-15):
- 张数严格线性:N 张参考图 ≈ N × 单张 token。16 张 1024² 参考图 ≈ 16384 tokens ≈ $0.13——已与一张
high输出($0.211)同量级,多图融合时不可忽略。 - 尺寸有下限也有封顶:小于等于 1024² 的方图统一按 1024 tokens 计(把图缩到 512 不省钱);2048² 与 4096² 同为 1521 tokens(超大图先缩放再换算,封顶)。单张参考图的 token 大致在 800-1600 区间浮动(含宽高比影响)。
- token 由像素尺寸决定,与文件体积无关:把图压到 1.5MB 是为了上传稳定和速度,不会减少 image token;反过来,费用也不会因为你传了 50MB 的原图而爆炸(有封顶)。
2K/4K 成本预估(像素比例外推,⚠️ 非官方固定价)
OpenAI 官方只公布了 1K 尺寸的固定每张单价表,2K/4K 没有官方逐尺寸定价。下表是 API易 按「像素总数比例」从上方 1K 官方单价外推的预估值,仅供预算参考:与 SaaS 套餐 / 积分制计费方式的区别
图像生成类工具厂商常见两种计费模式:- 包月套餐(订阅制):固定月费换取”每月可生成 N 张”的额度。这个额度背后是运营商按平均用量预估的超卖定价——套餐设计时就假设不是所有人都会用满,宣传的”单张成本”只是套餐价除以额度上限的理论值,跟你真实一张图的实际生成成本没有必然关系。
- 积分包 / 动态点数计费:把不同画质、尺寸的生成任务换算成不透明的”积分”消耗,本质上也是按量计费,只是用积分做了一层包装,掩盖了底层真实的 token 用量。
如何查看每次调用的真实 token 数
/v1/images/generations 和 /v1/images/edits 的响应都带 usage 字段,图片输入 token 和文本输入 token 是分开返回的,不用估算,直接读字段就能精确核算这一次调用的真实成本。下面是一次真实编辑请求(带 1 张参考图)返回的完整 usage(实测抓包):
分组介绍
gpt-image-2 官转目前提供两个分组,可在后台「令牌设置 → 分组」中切换:
image2Enterprise 即可临时过渡使用。

令牌设置:选择 image2Enterprise 分组(1.2x),常规资源不足时仍稳定
技术规格
端点一览
尺寸(size)详解
预设尺寸
自定义尺寸约束
gpt-image-2 接受任意合法尺寸,只需同时满足:
- 最大边 ≤ 3840px
- 两条边都是 16 的倍数
- 长短边比例 ≤ 3:1
- 总像素数 ∈ [655,360, 8,294,400](下限约 0.65MP,上限约 8.3MP)
1600x1200、1792x1024、2048x1536、3200x1800
非法示例:1000x1000(非 16 倍数)、4000x4000(超上限)、3840x1000(比例超 3:1)
画质(quality)详解
可选档位
quality 是影响价格最大的参数,比 size 更显著。 输出图片 token 量由 quality × size 共同决定,但 quality 的权重明显更高——同一尺寸下从 low 到 high,每张成本可相差 30 倍以上(参见上方「每张成本速查」表:1024×1024 从 low $0.006 到 high $0.211)。预算和选档时应优先按 quality 评估成本,再叠加 size 的影响。最佳实践
对接先跑 low 验证链路
quality=low + 预设尺寸跑通整条链路(鉴权、参数、超时、错误处理)。low 速度比 high 快数倍,能快速暴露所有非画质相关的问题,避免被长耗时干扰排查。尺寸优先选预设
画质按场景分档
low;默认 / 终稿 → medium;文字、精细纹理、印刷 → high。注意 low ↔ high 不仅是画面精美度差异,还包含推理复杂度差异——耗时差距可达数倍。输出格式选 JPEG
output_format=jpeg + output_compression=85 比 PNG 快且体积小一半以上。文字场景锁 high
quality=high。编辑场景准备参考图
超时分档配置(high 兜底 600 秒)
quality 与 size,尤其是 quality。建议按档位配置客户端超时:high 模式务必配 600 秒兜底,覆盖排队 / 长尾 / 服务抖动等各种异常情况;前端务必给进度反馈;服务端建议用任务队列解耦。迁移注意
gpt-image-1.5 迁移:删掉 input_fidelity(强制高保真,传了会报错);避开 background: transparent(暂不支持)。错误码与重试
- 请求超时按
quality分档配置:low≥ 120 秒 /medium≥ 240 秒 /high≥ 600 秒(兜底;实测 3–5 分钟,按 120/360 秒配会大量误超时) - 新接入先用
quality=low跑通链路,再按需升到medium/high - 对 5xx 与超时做 指数退避重试(建议 2 次)
- 记录响应头
x-request-id方便排查
常见问题
返回的 b64_json 要不要自己加 data:image/png;base64, 前缀?
返回的 b64_json 要不要自己加 data:image/png;base64, 前缀?
gpt-image-2 返回的是纯 base64 字符串(无前缀),与 gpt-image-2-all 不同。客户端有两种用法:- 写文件:
base64.b64decode(b64_str)后写入磁盘 - 浏览器渲染:
img.src = 'data:image/png;base64,' + b64_str自行拼前缀
为什么传 input_fidelity 会报 400?
为什么传 input_fidelity 会报 400?
gpt-image-2 强制启用 high-fidelity 处理参考图,不再接受 input_fidelity 参数。从 1.5 迁移时把这个字段移除即可,无需替换。想要透明背景怎么办?
想要透明背景怎么办?
gpt-image-2 暂不支持 background: transparent(会报错)。两个变通方案:- 把
background改为opaque/ 或不传,自行用 PIL / sharp / 在线工具抠透明 - 仍需透明背景的场景临时回退到
gpt-image-1.5
单次能出几张?
单次能出几张?
n=1)。如需 N 张请客户端并行 N 次调用。每次独立按 token 计费。2K/4K 出图为什么很慢?
2K/4K 出图为什么很慢?
quality=high + 高分辨率下耗时 ≈ 235 秒(约 4 分钟)单张,3840×2160 + high 长尾可接近 5 分钟。建议:- 新接入先用
quality=low跑通链路,确认正常后再按业务需求升档 - 客户端超时按档位配:
low≥ 120 秒 /medium≥ 240 秒 /high≥ 600 秒(兜底) - 前端显示”生成中”进度反馈
- 不需要 4K 时仍用 1024×1024 / 1536×1024 等 1K 预设
编辑请求为什么比文生图贵?
编辑请求为什么比文生图贵?
gpt-image-2 对参考图自动启用 high-fidelity 处理,参考图本身会按 Vision 计费规则换算成大量输入 token。带图编辑的输入 token 明显高于文生图,预算时要留足。尺寸、参考图都一样,为什么每次调用价格还不一样?
尺寸、参考图都一样,为什么每次调用价格还不一样?
quality 传了 auto(或没传)。 有客户反馈「尺寸、分辨率、参考图完全一样,价格却忽高忽低」,定位后发现请求里 size 和 quality 都用了 auto。问题出在 quality: auto:自动模式下,模型会自行理解需求、临时选择不同的质量档位去创作。档位不同 → 输出的 image token 数量不同 → 价格自然不同。下面是三次「输入完全一致(input 都是 1061 token)」却价格相差数倍的真实账单:auto 被模型判定为更高画质,输出 token 飙到 5146,价格也随之涨到约 3.5 倍。解决办法:不要让 quality 用 auto,显式传 low / medium / high。 固定档位后,相同输入的输出 token 量和价格才稳定可预期。详见上方「画质(quality)详解」章节。缓存计费(Cached Input)能享受到吗?
缓存计费(Cached Input)能享受到吗?
图片编辑接口的图片数量和大小限制?
图片编辑接口的图片数量和大小限制?
gpt-image-2 图片编辑接口(/v1/images/edits)最多支持上传 16 张参考图:- multipart/form-data 文件上传:每张图片小于 50MB,支持
png/jpg/webp - base64 data URL 方式:字段长度限制约 20MiB(schema
maxLength: 20971520,是字符串字段限制,不等同于 multipart 的 50MB 上限),实际原图建议控制在 15MB 以内 - mask 文件:单独限制为 PNG 且小于 4MB
编辑接口报 400「Invalid image file or mode for image 1」怎么办?
编辑接口报 400「Invalid image file or mode for image 1」怎么办?
code: invalid_image_file)的含义是:第 N 张参考图不是标准的 png / jpg / webp 格式(序号从 1 开始,按序号定位问题图)。最常见的根因是手机原拍照片的 MPO 格式:华为 Mate 系列等机型直出的 .jpg 内嵌 HDR 增益图副帧,实为多帧 JPEG 容器(MPO)。文件头同为 FFD8,扩展名和 file 命令都显示 JPEG,肉眼无法分辨——2026-07 实测 MPO 图必被拒,重编码为标准 JPEG/PNG 后原分辨率上传即成功(与尺寸、image[] 字段名、quality/size 参数均无关)。该错误在入口校验阶段返回,不计费。修复:上传前用 Pillow 重编码(Image.open(f).format 返回 "MPO" 即需转换):mask 文件怎么准备?
mask 文件怎么准备?
- 与原图相同尺寸,PNG 格式,单张小于 4MB
- 必须带 alpha 通道:透明区域(alpha=0)= 要重绘的部分,不透明区域 = 保留
- 仅对第一张 image 生效
- mask 是”软引导”非精确边界,模型可能在蒙版周围扩展 / 收敛
和 gpt-image-2-all 怎么选?
和 gpt-image-2-all 怎么选?
能用 OpenAI 的官方 SDK 直连吗?
能用 OpenAI 的官方 SDK 直连吗?
base_url 指向 https://api.apiyi.com/v1,api_key 设为 API易 令牌即可:支持主动中断生成任务吗?
支持主动中断生成任务吗?
gpt-image-2 走 OpenAI 官方同步端点,请求一旦提交就会跑到结束,无法发出”取消”指令。客户端即使断开连接,服务端仍会把这次生成完整跑完并照常计费。建议在客户端做好超时控制,不要依赖”断连就不收费”的假设。有请求速率限制(RPM)吗?
有请求速率限制(RPM)吗?
支持异步调用吗?
支持异步调用吗?
gpt-image-2 严格与 OpenAI 官方一致——只有同步调用,发起请求后阻塞等待结果(high 档 + 4K 实测 1–2 分钟)。如需异步队列、回调通知等能力:- 在业务层用任务队列(Celery / BullMQ 等)自行封装异步
- 或改用
gpt-image-2-all,出图约 30–60 秒,更适合前端轮询
生成失败会扣费吗?
生成失败会扣费吗?
400 错误并不计费。典型响应:401(令牌无效)、429(限流)。只有请求实际进入模型生成阶段(即收到 200 + b64_json)才会按 token 计费。相关文档
- ⚖️ 官转 vs 官逆 对比 - 选型对照表,帮你决定用哪个
- 文生图 Playground -
/v1/images/generations在线调试 - 图片编辑 Playground -
/v1/images/edits多图融合 + mask - 深度解读:gpt-image-2 上线说明 - News 文章
- 完整接入文档(中文) - 完整 API 参考
- GPT-Image-2-All(官逆版本) - 更便宜、更快的备选方案
- 社区贡献:Luck GPT-Image 2 ComfyUI 节点 - 在 ComfyUI 中一键调用
gpt-image-2(含 mask / 5 图输入 / 自定义尺寸) - 社区贡献:APIYI GPT-Image 2 Skills - 在 Codex CLI / Cursor / Gemini CLI 等 AI 编程工具中一句话调用
- API 使用手册 - 通用调用规范
gpt-image-2 是 OpenAI 官方旗舰,按 token 实计;如果你更看重统一定价($0.03/张)和出图速度(30–60s),可参考 gpt-image-2-all。