gpt-5.4 进行图像理解,以及 grok-imagine-image 进行图像生成。
图像理解
发送公网图片 URL,或读取本地图片并以 Base64 方式传入。
图像生成
根据文本提示词生成图片,并将返回的 Base64 内容保存为本地文件。
图像编辑
基于已有图片进行编辑,具体能力取决于所选模型。
提示词建议
用主体、风格、构图和约束描述你需要的图片。
图像理解
图像理解使用 OpenAI 兼容的chat/completions 接口。图片可以传公网 URL,也可以把本地图片转为 Base64 后通过 data: URI 传入。示例模型为 gpt-5.4。
使用本地图片
本地图片会由代码读取并自动转换为 Base64,再随请求发送。Python 示例中的IMAGE_PATH = "photo.jpg" 表示图片与 Python 文件放在同一项目文件夹,且文件名必须与实际图片完全一致,包括扩展名和大小写;图片在其他位置时,改为完整本地路径。Node.js 示例使用 const IMAGE_PATH = "photo.png",将图片与 .mjs 文件放在同一项目文件夹后,从该文件夹终端运行代码。若文件名或格式不同,修改 IMAGE_PATH 与 IMAGE_MIME_TYPE。
Python 和 Node.js 示例的依赖安装、运行方式及环境问题,参阅 常见问题。
图像生成
图像生成使用 OpenAI 兼容的/v1/images/generations 接口。本页示例使用 grok-imagine-image;不同模型支持的尺寸、数量和返回格式可能不同,接入前请先在模型广场确认模型名称与计费方式。
图像编辑
图像编辑用于基于已有图片修改背景、局部内容或整体风格。编辑接口、文件上传方式和可用参数由模型决定;调用前请在模型广场确认所选模型支持图像编辑。提示词建议
- 描述主体、风格、构图、光线、色调及背景。
- 明确图片用途和限制,例如尺寸比例、需要保留或避免的元素。
- 需要稳定字段时,将图像理解与 结构化输出 结合使用。
计费说明
- 图像理解:图像会被换算为一定数量的输入 Token 参与计费,图像越大或越清晰,Token 越多。
- 图像生成与编辑:通常按次固定计费,也可能随尺寸或模型而变化。
注意事项
- 仅使用模型广场标记支持对应能力的模型。
- 过大的图像会消耗更多 Token 或被拒绝,必要时先压缩。
- 使用图片 URL 时,确保该 URL 可被公网访问。
