Skip to main content
POST
Gemini 图像模型不走 /v1/images/*。它和文本模型一样通过 generateContent 生成图像,图像字节以 inline part 的形式,和模型输出的文本一起返回。 GPT 图像模型请改用 POST /v1/images/generations。 完整的文生图、图生图示例见 Nano Banana。
模型 ID 会随时间变化。用 GET /v1/models 查询你的账户当前可用的模型。

端点

和所有 Gemini 路由一样,用 x-goog-api-key 认证。见 Gemini 总览。
array
必填
对话轮次。文生图只需一个 user 轮次、一个文本 part;图生图则在同一轮次里追加源图的 inline part。
object
Gemini 标准生成配置。图像模型还接受尺寸相关的控制项,但各模型支持的宽高比和分辨率不同,依赖具体取值前请先确认该模型的能力。
array
生成结果。
object
Token 用量。生成的图像按图像输出 token 计费,这部分是费用的主要来源,见 价格。

解析响应

两个习惯能省掉不少麻烦:
  • 遍历每一个 part。 让模型生成带插图的说明时,文本和图像 part 是交错的。只取第一个 part 会静默丢内容。
  • 要能接受纯文本响应。 提示词因安全策略被拒时,响应仍是 200,只有文本 part,没有 inlineData。解码前先确认图像 part 存在。
Gemini 生成的图像带有 SynthID 水印。

错误

Gemini 路由返回 Gemini 的错误结构,不是 OpenAI 那套。完整映射见 错误处理。
contents 结构有误、inline part 的 mimeType 不受支持,或尺寸取值模型不接受。
缺少或填错 x-goog-api-key。