Skip to main content
Moxus AI 将常用多模块能力放在统一 API 网关下。你可以用同一套账户、API 密钥和计费体系调用文本、图像与文档处理模型。
多模态能力是否可用取决于模型本身和 API 密钥限制。调用前请在模型广场确认模型能力标签。

图像理解

让模型读取图片内容,完成描述、识别、对比、信息抽取和视觉问答。

图像生成

根据文本提示生成图像,或基于已有图片进行风格调整与编辑。

PDF 文件

将 PDF 内容作为上下文输入模型,用于总结、问答、提取字段和生成结构化结果。

Markdown 文件

将 README、说明文档、变更记录等 Markdown 内容作为文本上下文输入对话或 API。

图像理解

图像理解用于让模型读取图片,并返回文字分析结果。常见任务包括图片描述、商品识别、票据字段提取、截图问答和图文混合推理。
图像越清晰、问题越具体,输出越稳定。需要结构化结果时,可以结合 结构化输出

图像生成

图像生成用于根据提示词创建图片,或以已有图片作为参考进行编辑。你可以把生成任务用于配图、草图、海报、概念设计和素材迭代。

PDF 文件

PDF 文件通常先作为文档内容输入模型,再让模型执行总结、问答、字段抽取或格式转换。对于长文档,建议先拆分章节或页码,并在请求中明确需要处理的范围。

Markdown 文件

Markdown 文件适合处理 README、接口说明、项目笔记、知识库条目和变更记录。“对话”支持直接上传 .md.markdown 文件;接口调用时,将 Markdown 正文作为文本放入 messages.content,模型即可按普通上下文读取。
Markdown 文件在请求中按文本计入输入 Token。内容较长时,建议保留标题、列表和关键代码块,删掉无关日志或重复段落。
不要把包含敏感个人信息、未脱敏合同、内部机密或私有代码的文档上传给不应访问该内容的模型或密钥。生产环境建议按项目隔离 API 密钥。

后续步骤