先看任务,再选模型系列
“国产大模型”不是一种统一的 API。聊天模型可以回答问题或调用工具,图像、视频与语音模型通常有各自的输入、输出和任务状态。先把业务任务写清楚,再比较同类模型,能更快找到合适的接入方式。
- 文本与代码
- 用真实的中文问答、代码修改或结构化抽取样本,比较结果、工具调用、延迟与用量。
- 图片与文档理解
- 确认目标型号能接收图片、PDF 或其他文件;文件解析能力不应从品牌名称推断。
- 图像与视频生成
- 将文生图、图片编辑、文生视频、图生视频分开;核对尺寸、时长和任务查询方式。
- 语音与检索
- 区分语音识别、语音合成、实时对话、向量化和重排序;它们解决不同问题。
Qwen / 通义千问 API
阿里云百炼Qwen 是模型系列,覆盖文本生成、视觉理解、音频和向量检索等方向。中文客服、内容处理与知识库问答可以先从文本任务试跑;需要图片理解或检索时,再选择对应模态的型号。
搭建 RAG 时,生成回答的聊天模型、生成向量的 Embedding 模型和重排序模型分别承担不同步骤,不宜只按“千问”两个字选一个接口。
官方资料:百炼模型列表OpenAI 兼容调用说明
GLM / 智谱 AI API
文本、工具与视觉任务GLM 可以纳入中文知识问答、代码和智能体工作流的候选。若应用依赖函数调用或结构化输出,建议用真实业务问题测试工具参数与 JSON 结果,而不是只看一次普通对话。
图像理解与图像生成属于不同任务。选择 GLM 系列时,要根据官方能力说明核对目标型号的输入模态和接口,再设计请求体。
官方资料:智谱模型概览
Kimi / 月之暗面 API
长文与代码工作流Kimi 可以纳入长文档阅读、复杂问答与代码代理的评测。输入量大的场景要同时观察答案质量、实际用量和响应时间;标称上下文长度并不代表每种输入格式都采用相同处理方式。
如果流程包含图片、文件或工具调用,先确定型号和对应参数,再用同一组任务样本比较普通问答与多步骤执行。
官方资料:Kimi 开放平台与模型介绍
豆包 / Doubao Seed API
火山方舟豆包相关能力包括 Seed 文本与多模态理解、Seedream 图像创作、Seedance 视频生成。电商内容、图片素材和短视频生产可以分别评测这些任务,但不能把视频生成请求当作普通聊天请求发送。
视频任务还需要考虑文生视频或图生视频的输入差异、异步任务状态、产物规格和时长;图像编辑则要核对参考图与输出格式。
官方资料:火山方舟模型列表
MiniMax API
文本、语音与视频MiniMax 的语言模型可用于代码与文本工作流,语音系列面向语音合成,视频系列面向视频生成。做有声内容时先确定是把文字转成语音,还是让模型理解语音输入;两者所需的接口不同。
评测视频生成时,区分文生视频、图生视频和首尾帧等输入方式,并记录任务完成时间与输出规格。
官方资料:MiniMax 官方模型介绍
接入前,用四步核查接口
- 确定任务和模态。明确输入是文本、图片、文件或音频,输出是文字、图片、视频还是语音。
- 确定型号和协议。核对精确模型 ID、Chat 或 Responses 等文本接口,以及媒体任务是否使用独立端点。
- 跑通最小业务样本。先用一条真实请求验证返回结构,再检查流式响应、工具调用、失败处理等必需能力。
- 记录用量并比较。文本看输入与输出 Token;图片、视频和语音还要看各自的计量方式,避免只比较一次请求的表面费用。
了解 Midalo 的统一接入思路,可读AI API 接入指南;具体请求格式请看接入文档。
国产模型 API 常见问题
Qwen API 和通义千问 API 是同一回事吗?
日常说的“Qwen”或“通义千问”通常指一整个模型系列。实际开发仍需选定具体型号、任务和调用接口。阿里云百炼文档把文本、多模态、向量等能力分开列出。
国产模型都能直接复用 OpenAI SDK 吗?
一些文本接口提供 OpenAI 兼容调用方式,但兼容范围因型号和平台而异。接入时应分别验证请求路径、消息格式、流式输出、工具调用与错误返回;图像、视频和语音可能使用专用接口。
文本模型能直接生成图片或视频吗?
文本对话、图像生成和视频生成是不同任务。一个厂商可能同时提供几类模型,但它们的请求参数、生成过程和返回内容并不相同。先选任务类型,再查对应型号和 API。
为什么同一个系列还要核对精确模型 ID?
同系列下的型号可能面向不同模态、速度或上下文范围,并随版本更新。使用精确 ID 才能对应到官方能力说明和实际请求结果。
