MIDALO · 模型系列指南

主流 AI 模型怎么选?先看任务,再看型号

GPT、Claude、Gemini、DeepSeek、Grok、Qwen、GLM、Kimi、豆包和 MiniMax 各有不同的模型与接口。先明确要做文本、图像、视频、语音还是检索,再核对精确型号,选型会比只看品牌名更可靠。

需要国产模型接入?Midalo 提供千问(Qwen)、GLM、Kimi、豆包、MiniMax 等系列。查看国产模型 API 接入指南,告知所需型号和使用场景,获取可用接口、报价与开通说明。具体可调用范围以账户配置和服务确认为准。

先确定你要模型完成什么

一个厂商可能同时提供聊天、图像和语音模型,但它们的 API 路径、输入格式、计费单位并不相同。下面的任务分类用于缩小候选范围,具体能力还要以所选型号的官方文档为准。

写作、问答与代码

先比较文本模型的指令遵循、工具调用、上下文和实际响应时间;用自己的任务样本试跑。

文档与图像理解

核对是否接受图片、PDF 或视频输入,以及文件大小、页数和上下文限制。

图像生成与编辑

确认是生成、局部编辑还是多图参考;检查尺寸、输入素材和输出文件规则。

视频生成

看文生视频、图生视频、首尾帧和延长是否分别支持,并核对任务轮询与计费。

语音识别与合成

将 ASR、TTS 和实时双向语音分开比较,重点看语言、时延、音频格式与用量单位。

知识库检索

向量模型负责把内容转成可检索表示;重排序模型负责重排候选,两者不直接代替聊天模型。

十个常见模型系列,分别怎么查

按用途浏览十个系列:先确认要完成的任务,再查看各系列的接口要求和接入路径。国产系列的 Midalo 接入说明可在下方卡片进入。

可到 Midalo 目录核对的系列

GPT / OpenAI

实时核对

可从通用文本与代码任务开始评估;图像、语音、向量另有专用模型。

核对:精确模型 ID、Responses 或 Chat 接口、输入输出模态。

Claude / Anthropic

实时核对

适合纳入长文处理、代码和工具工作流的候选清单。

核对:模型 ID、Messages API、工具和上下文限制。

Gemini / Google

实时核对

覆盖文本、多模态理解和部分媒体生成;同系列内也要区分输入和输出能力。

核对:型号、原生接口、模态、预览状态与地区。

DeepSeek

实时核对

可作为推理、代码和普通文本任务的候选,具体能力取决于型号与调用方式。

核对:当前模型 ID、思考模式、实际支持的 API 路径。

Grok / xAI

实时核对

可纳入文本与代码比较;若任务需要当前外部信息,应另核对搜索工具。

核对:模型 ID、工具开关,以及图像、视频、语音专用接口。

国产模型 API 接入系列

Qwen / 通义千问

支持接入

包含文本、视觉、音频、向量等不同方向;不要把“千问”当成一个通用型号。

核对:模型 ID、地域、模态,以及 OpenAI 兼容或 DashScope 接口。

GLM / 智谱

支持接入

文本、视觉理解和图像能力分属不同型号,需按任务选择。

核对:型号、上下文、结构化输出与 API 兼容方式。

Kimi / 月之暗面

支持接入

可纳入长文档、编程与智能体任务的评估,具体模式随型号而变。

核对:模型 ID、输入模态、缓存规则与上下文范围。

豆包 / ByteDance Seed

支持接入

文本模型与 Seedream 图像、Seedance 视频等产品线应分别选型。

核对:火山方舟的模型 ID、任务接口、素材规则和地区。

MiniMax

支持接入

覆盖文本、语音、图像和视频;各任务的请求格式并不相同。

核对:模型 ID、同步或异步接口、输出格式与用量单位。

别把图像、视频、语音与向量混为“聊天模型”

下面是图像、视频、语音与向量任务的例子。可从模型目录国产模型接入指南继续查对应接口与选型步骤。

图像生成
GPT ImageNano BananaSeedream 都属于图像方向。先问清生成、编辑、参考图和尺寸,再核对精确型号与接口。
视频生成
Seedance 是视频模型系列示例。视频常是提交任务后查询结果;需核对时长、画幅、素材、返回方式与失败计费。
语音任务
OpenAI 的转写与 TTSMiniMax 的语音系列说明识别、合成和实时对话是不同任务;要核对音频格式、语言与延迟。
向量检索
OpenAI 的 text-embedding-3-large千问向量系列用于把内容表示成向量。实际检索还要考虑切分、索引、重排序和召回评估。

从候选模型到实际接入,核对这五项

  1. 精确型号:先记录厂商官方模型 ID,再看目标平台当前目录。家族名、别名和版本快照不能混用。
  2. 协议与功能:确认客户端需要 Chat Completions、Responses、Anthropic Messages、Gemini 原生格式,还是图像、音视频专用接口;同一个兼容入口不保证所有字段都受支持。可结合中转接入指南接入文档核对。
  3. 权限与来源:目录可见、请求成功和有权长期使用是不同问题。核对账号分组、密钥限制、地区与使用条款;消费端订阅也不能直接等同于 API 权限。遇到 OAI、CCMax、逆向或号池等叫法,可先读渠道术语说明
  4. 价格与额度:比较输入、缓存输入、输出、图像张数、视频时长等正确单位;先查看Midalo 模型价格,目标型号不在目录时可联系 Midalo 获取报价。旧文章和厂商官网价格不能代替账户实际结算。
  5. 小样本验证:用自己的代表性请求检查返回内容、工具调用、延迟和使用日志,再决定是否扩大流量;HTTP 成功码本身不足以证明任务完成。

常见问题

怎样确认目标型号和报价?

可先查在线模型目录;如需 Qwen、GLM、Kimi、豆包或 MiniMax 的具体型号,请说明用途并联系 Midalo,获取接口、报价和开通信息。

同一厂商的图像、视频或语音模型能直接替换聊天模型 ID 吗?

通常不行。先看官方文档要求的端点、请求体和返回方式,再核对目标平台是否开放对应接口。

选型时只看官方基准或标价可以吗?

建议用自己的输入样本比较输出质量、速度和实际费用;缓存、地区、分组与任务计价会改变结果。

官方资料与页面范围核查:。型号、权限和价格会变动,操作前请打开相应官方资料及实时目录复核。