先确定你要模型完成什么
一个厂商可能同时提供聊天、图像和语音模型,但它们的 API 路径、输入格式、计费单位并不相同。下面的任务分类用于缩小候选范围,具体能力还要以所选型号的官方文档为准。
写作、问答与代码
先比较文本模型的指令遵循、工具调用、上下文和实际响应时间;用自己的任务样本试跑。
文档与图像理解
核对是否接受图片、PDF 或视频输入,以及文件大小、页数和上下文限制。
图像生成与编辑
确认是生成、局部编辑还是多图参考;检查尺寸、输入素材和输出文件规则。
视频生成
看文生视频、图生视频、首尾帧和延长是否分别支持,并核对任务轮询与计费。
语音识别与合成
将 ASR、TTS 和实时双向语音分开比较,重点看语言、时延、音频格式与用量单位。
知识库检索
向量模型负责把内容转成可检索表示;重排序模型负责重排候选,两者不直接代替聊天模型。
十个常见模型系列,分别怎么查
按用途浏览十个系列:先确认要完成的任务,再查看各系列的接口要求和接入路径。国产系列的 Midalo 接入说明可在下方卡片进入。
可到 Midalo 目录核对的系列
GPT / OpenAI
实时核对可从通用文本与代码任务开始评估;图像、语音、向量另有专用模型。
核对:精确模型 ID、Responses 或 Chat 接口、输入输出模态。
DeepSeek
实时核对可作为推理、代码和普通文本任务的候选,具体能力取决于型号与调用方式。
核对:当前模型 ID、思考模式、实际支持的 API 路径。
国产模型 API 接入系列
Qwen / 通义千问
支持接入包含文本、视觉、音频、向量等不同方向;不要把“千问”当成一个通用型号。
核对:模型 ID、地域、模态,以及 OpenAI 兼容或 DashScope 接口。
豆包 / ByteDance Seed
支持接入文本模型与 Seedream 图像、Seedance 视频等产品线应分别选型。
核对:火山方舟的模型 ID、任务接口、素材规则和地区。
别把图像、视频、语音与向量混为“聊天模型”
下面是图像、视频、语音与向量任务的例子。可从模型目录或国产模型接入指南继续查对应接口与选型步骤。
- 图像生成
- GPT Image、Nano Banana、Seedream 都属于图像方向。先问清生成、编辑、参考图和尺寸,再核对精确型号与接口。
- 视频生成
- Seedance 是视频模型系列示例。视频常是提交任务后查询结果;需核对时长、画幅、素材、返回方式与失败计费。
- 语音任务
- OpenAI 的转写与 TTS、MiniMax 的语音系列说明识别、合成和实时对话是不同任务;要核对音频格式、语言与延迟。
- 向量检索
- OpenAI 的 text-embedding-3-large 和千问向量系列用于把内容表示成向量。实际检索还要考虑切分、索引、重排序和召回评估。
从候选模型到实际接入,核对这五项
- 精确型号:先记录厂商官方模型 ID,再看目标平台当前目录。家族名、别名和版本快照不能混用。
- 协议与功能:确认客户端需要 Chat Completions、Responses、Anthropic Messages、Gemini 原生格式,还是图像、音视频专用接口;同一个兼容入口不保证所有字段都受支持。可结合中转接入指南与接入文档核对。
- 权限与来源:目录可见、请求成功和有权长期使用是不同问题。核对账号分组、密钥限制、地区与使用条款;消费端订阅也不能直接等同于 API 权限。遇到 OAI、CCMax、逆向或号池等叫法,可先读渠道术语说明。
- 价格与额度:比较输入、缓存输入、输出、图像张数、视频时长等正确单位;先查看Midalo 模型价格,目标型号不在目录时可联系 Midalo 获取报价。旧文章和厂商官网价格不能代替账户实际结算。
- 小样本验证:用自己的代表性请求检查返回内容、工具调用、延迟和使用日志,再决定是否扩大流量;HTTP 成功码本身不足以证明任务完成。
常见问题
同一厂商的图像、视频或语音模型能直接替换聊天模型 ID 吗?
通常不行。先看官方文档要求的端点、请求体和返回方式,再核对目标平台是否开放对应接口。
选型时只看官方基准或标价可以吗?
建议用自己的输入样本比较输出质量、速度和实际费用;缓存、地区、分组与任务计价会改变结果。
官方资料与页面范围核查:。型号、权限和价格会变动,操作前请打开相应官方资料及实时目录复核。
