MiniMax-M3.1-Flash-Preview 暂时仅通过 Token Plan 和 MiniMax Code 提供。获取订阅 Key。
模型概览
MiniMax 提供多款语言模型,满足不同场景需求。MiniMax-M3.1-Flash-Preview 是最新 M 系列语言模型,适用于 Agent 推理、工具调用、代码和长上下文任务,并支持通过effort 调节思考深度。MiniMax-M3、MiniMax-M2.7 及 MiniMax-M2.7-highspeed 也正常提供服务;更早的型号收录在下方的历史模型中。
支持模型
历史模型
历史模型
TPS(Tokens Per Second)的计算方式详见常见问题 > 接口相关。
MiniMax M3.1-Flash-Preview 核心亮点
1M 上下文
1M 上下文
MiniMax-M3.1-Flash-Preview 支持最高 1,000,000 token 上下文,适用于长文档、代码库和多步骤 Agent 会话。
Agent 与代码场景
Agent 与代码场景
MiniMax-M3.1-Flash-Preview 面向 Agent 推理、工具调用、代码和结构化任务执行优化。
思考深度可调(effort)
思考深度可调(effort)
通过
effort 调节思考深度,可取 low、medium、high、xhigh、max,档位越高思考越充分。省略时默认使用 max 档位。详见深度思考。多模态 Chat 输入
多模态 Chat 输入
支持文本、图片和视频等多模态输入,适用于丰富的内容理解与分析场景。
URL 配置
调用 MiniMax 模型前,请先准备好以下信息:调用示例
MiniMax 同时兼容 Anthropic 和 OpenAI 两种 API 协议格式,下面给出两套等价的非流式样例。需要流式响应时,把请求里的stream 改成 true 即可。
Anthropic 兼容(推荐)
支持 thinking 块、interleaved thinking 等高级特性,是默认推荐路径。OpenAI 兼容
如果你的项目已经接入 OpenAI SDK,把base_url 和 model 换成下方的值即可直接复用,无需迁移到新 SDK。
深度思考
MiniMax-M3.1-Flash-Preview 在回答前会先进行推理,把复杂问题拆解成多步分析后再作答,在 Agent 推理、工具调用、代码和数学等任务上能明显提升准确性。深度思考默认开启,无需额外配置。 思考内容与最终回答分开返回:在 OpenAI 兼容协议下,思考内容固定通过reasoning_content 字段单独给出,content 只含最终回答,可以直接用于展示,不需要从 <think> 标签里自行解析。
思考深度档位(effort)
effort 可取 low、medium、high、xhigh、max,档位越高思考越充分、耗时和输出 token 也越多。MiniMax-M3.1-Flash-Preview 省略 effort 时默认为 max。不同协议下的字段名不同:
Anthropic 兼容接口中,显式设置
output_config.effort 为 max:
使用限制
深度思考不支持关闭。传入thinking: {"type": "disabled"} 或 effort: "none" 会返回 400:
effort 档位,而不是关闭思考。
API 参考
Anthropic API 兼容(推荐)
通过 Anthropic SDK 调用 MiniMax 模型,支持流式输出和 Interleaved Thinking
OpenAI API 兼容
通过 OpenAI SDK 调用 MiniMax 模型
在 AI 编程工具里使用 MiniMax M 系列模型
在 Claude Code、Cursor 等工具中使用 MiniMax M 系列模型
Chat Model
M2-her 对话模型,专为角色扮演、多轮对话等场景设计
联系我们
如果在使用 MiniMax 模型过程中遇到任何问题:- 通过邮箱 Model@minimaxi.com 等官方渠道联系我们的技术支持团队
- 在我们的 Github 仓库提交 Issue