OpenAI 兼容接口通常使用
chat/completions,在消息中同时传入文本和图片 URL 或图片数据。可用模型以模型广场的视觉能力标签为准。适合场景
- 截图问答:让模型解释网页、控制台、报错截图或产品界面。
- 票据识别:从发票、账单、收据中提取金额、日期、商户等字段。
- 商品与素材分析:识别图中对象、风格、颜色、构图与使用场景。
- 图表理解:读取图表趋势,并生成简短摘要。
调用建议
1
选择视觉模型
在模型广场筛选支持视觉输入的模型,并记录模型名称。
2
准备图片输入
使用可访问的图片 URL,或按模型要求传入 Base64 图片数据。
3
明确提问目标
在文本提示中说明你需要描述、比对、抽取字段,还是输出 JSON。
API 调用
图像理解的 cURL、Python 和 Node.js 示例已统一维护在 视觉与图像生成。示例模型为gpt-5.4。
