图像生成概览
哪个图像模型走哪个端点、GPT 的两套入口怎么选、图片返回的两种形态,以及各页导航
图像生成分散在三个端点上,先确认你要的模型走哪一个:
| 模型 | 端点 | 页面 |
|---|---|---|
gpt-image-2(gpt-image-2.5-* 当前未开放) | /v1/images/generations · /v1/images/edits | GPT 图像 · Image API |
gpt-6-astra + image_generation 工具 | /v1/responses | GPT 图像 · Responses |
gemini-3-pro-image · gemini-3.1-flash-image · gemini-3.1-flash-lite-image(含 -preview) | /v1beta/models/{model}:generateContent | Gemini 图像生成 |
grok-imagine-image-2.0 · grok-imagine-image-quality | /v1/images/generations · /v1/images/edits | Grok 图像 |
wan3.0-image-* | /v1/videos(图生视频,不是出图) | 万相 3.0 |
GPT 的两套入口
| Image API | Responses | |
|---|---|---|
| 调用模型 | gpt-image-2,直接指定 | gpt-6-astra 内部调度,无法指定 |
size / quality | 按请求执行,4K + high 精确返回 | 被改写:要 4K/high 实得 1536×1024/medium |
| 耗时 | 4K + high 约 45–57 秒 | 40–170 秒 |
| 多轮编辑 / 自动优化提示词 | 无 | 有 |
默认用 Image API;只在需要对话式多轮编辑时用 Responses。
三条通用约束
- 图片返回有两种形态。 Image API 的
data[0]可能是b64_json(内联)也可能是url(临时链接,尽快下载),response_format不决定形态,两种都要处理。 - Gemini 生图必须走原生端点。 走 Chat 兼容协议能出图,但
imageConfig(画幅、分辨率)会在协议转换中丢掉。 - Grok 2.0 画幅固定 1248×832。 需要竖图用
grok-imagine-image-quality,它 2026-11-02 退役。
实测样图
各页附真实调用产出的样图:GPT 六主题 4K(东方水墨、仙侠、工笔重彩、空间站、巨构城市、戴森云)在 Image API 页, Responses 降级对照在 Responses 页。缩略图点击可放大。