MiniMax-M3.1-Flash-Preview 暂时仅通过 Token Plan 和 MiniMax Code 提供。
快速开始
1. 安装 OpenAI SDK
2. 配置环境变量
3. 调用 API
Python
4. 特别注意
在多轮 Function Call 对话中,必须将完整的模型返回(即 assistant 消息)添加到对话历史,以保持思维链的连续性:- 将完整的
response_message对象(包含tool_calls字段)添加到消息历史- 原生的OpenAI API 的
MiniMax-M3.1-Flash-PreviewMiniMax-M3MiniMax-M2.7MiniMax-M2.7-highspeedMiniMax-M2.5MiniMax-M2.5-highspeedMiniMax-M2.1MiniMax-M2.1-highspeedMiniMax-M2模型content字段会包含<think>标签内容,需要完整保留 MiniMax-M3.1-Flash-Preview的模型思考内容通过reasoning_content字段单独提供,同样需要完整保留
- 原生的OpenAI API 的
支持的模型
使用 OpenAI SDK 时,支持以下 MiniMax 模型:TPS(Tokens Per Second)的计算方式详见常见问题 > 接口相关。
更多模型信息请参考标准的 MiniMax API 接口文档。
多模态输入
OpenAI API 兼容的 Chat Completions 支持在MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 中输入文本、图片和视频。
图片使用 image_url 内容块,视频使用 video_url 内容块。detail 字段可取 low、default、high,默认值为 default;可通过 max_long_side_pixel 控制最长边。图片支持 JPEG、PNG、GIF、WEBP。视频支持 MP4、AVI、MOV、MKV;fps 默认值为 1,支持 0.2 到 5。URL 或 base64 视频最大 50 MB,图片最大 10 MB,请求体最大 64 MB。更大的视频请通过 Files API 上传后传入 mm_file://{file_id},Files API 视频最大 512 MB。
图片 token 用量会随图片尺寸和内容变化。以下是单张图片的粗略估算;准确用量以响应中的 usage 或可用的 token 计数接口为准:
Python
MiniMax-M3.1-Flash-Preview / MiniMax-M3 请求参数
MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 在 OpenAI API 兼容接口中支持以下额外的 Chat Completions 参数:
Thinking 控制
thinking 参数用于控制模型是否可以输出 thinking 内容。不同模型的行为不同:
传入
thinking: {"type": "disabled"} 或 reasoning_effort: "none" 时返回的错误信息:Python
思考深度控制(仅 MiniMax-M3.1-Flash-Preview)
MiniMax-M3.1-Flash-Preview 支持通过 reasoning_effort 调节思考深度,档位从低到高为 low、medium、high、xhigh、max。档位越高,模型思考越充分,输出的 thinking token 和响应耗时也越多。省略 reasoning_effort 时默认为 max。
none 不支持,会返回 400。
Python
示例代码
流式响应
Python
Tool Use & Interleaved Thinking
了解如何通过 OpenAI SDK 使用 M3.1-Flash-Preview Tool Use 和 Interleaved Thinking 能力,请参考以下文档。Tool Use & Interleaved Thinking
了解如何利用 MiniMax-M3.1-Flash-Preview 工具调用和 Interleaved Thinking 能力,提升复杂任务中的表现。
注意事项
如果在使用MiniMax模型过程中遇到任何问题:- 通过邮箱 Model@minimaxi.com 等官方渠道联系我们的技术支持团队
- 在我们的 Github 仓库提交Issue