Skip to main content
POST
✨ 全新模型 MiniMax-M3.1-Flash-Preview核心能力:1M 超长上下文、多模态、思考深度可调。暂时仅通过 Token Plan 和 MiniMax Code 提供。
MiniMax-M3.1-Flash-Preview 新特性:
  1. 支持图片、视频理解,可参考右方示例代码
  2. 支持通过 output_config.effort 调节思考深度,可取 low、medium、high、xhigh、max,默认档位为 max
  3. 深度思考默认开启,无需额外配置;思考内容通过 thinking 内容块单独返回

授权

Authorization
string
header
必填

Bearer API Key 鉴权。发送 Authorization: Bearer <API_KEY>。如果 Authorization 和 x-api-key 同时存在,优先使用 Authorization。

请求头

Content-Type
enum<string>
默认值:application/json
必填

请求体的媒介类型,请设置为 application/json,确保请求数据的格式为 JSON

可用选项:
application/json

请求体

application/json
model
enum<string>
必填

模型 ID。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 是多模态模型,原生支持文本、图片和视频输入,并兼容工具调用与 thinking 内容块;MiniMax-M3.1-Flash-Preview 还会强制开启 thinking,并支持通过 output_config.effort 调节思考深度。M2.7、M2.5、M2.1 和 M2 系列仅支持文本与工具调用,不支持图片和视频输入。

可用选项:
MiniMax-M3.1-Flash-Preview,
MiniMax-M3,
MiniMax-M2.7,
MiniMax-M2.7-highspeed,
MiniMax-M2.5,
MiniMax-M2.5-highspeed,
MiniMax-M2.1,
MiniMax-M2.1-highspeed,
MiniMax-M2
messages
object[]
必填

对话历史。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 支持文本、图片、视频、工具调用、工具结果和 thinking 内容块。M2.7、M2.5、M2.1 和 M2 系列仅支持文本与工具调用相关内容块,不支持图片和视频输入。

service_tier
enum<string>
默认值:standard

请求准入服务层级。支持的取值为 standard 和 priority。省略时默认使用 standard。priority 的价格为 standard 的 1.5 倍,并会确保请求获得优先准入,使其排在其他请求之前处理,从而带来更快响应并减少失败。

可用选项:
standard,
priority
system

设置模型角色与行为。

stream
boolean
默认值:false

是否使用流式传输,默认为 false。设置为 true 后,响应将分批返回

max_tokens
integer<int64>

指定生成内容长度的上限(Token 数)。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 推荐值为 131072(128K),上限为 524288(512K);其他模型推荐值为 65536(64K),上限为 204800(200K)。超过上限的内容会被截断。如果生成因 length 原因中断,请尝试调高此值

必填范围: x >= 1
temperature
number<double>
默认值:1

温度系数,影响输出随机性,取值范围 [0, 2],默认值为 1。值越高,输出越随机;值越低,输出越确定。

必填范围: 0 <= x <= 2
top_p
number<double>
默认值:0.95

核采样参数,取值范围 [0, 1]。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 默认值为 0.95,M2.x 系列模型默认值为 0.9。

必填范围: 0 <= x <= 1
tools
object[]

Anthropic 兼容工具调用的工具定义。

tool_choice
object

工具选择策略。仅支持 auto 和 none。

thinking
object

控制 thinking 行为。默认值随模型不同,因此未在 schema 层声明统一默认值。

  • MiniMax-M3.1-Flash-Preview:强制开启 thinking。若传入 type 只能为 adaptive;传入 disabled 会返回 HTTP 400。如需调节思考深度,请使用 output_config.effort。
  • MiniMax-M3:省略 thinking 时默认关闭;传入 adaptive 可开启并返回 thinking 块。
  • M2.x 模型:thinking 无法关闭,传入 disabled 会被接收但不生效。
output_config
object

输出配置。通过 effort 调节 MiniMax-M3.1-Flash-Preview 的思考深度。

metadata
object

请求元信息。建议对 to-C 业务传入 user_id,便于按终端用户聚合限流和计费分析。

响应

id
string

本次响应的唯一 ID

type
enum<string>

对象类型,固定为 message

可用选项:
message
role
enum<string>

角色,固定为 assistant

可用选项:
assistant
model
string

本次请求使用的模型 ID

content
object[]

响应内容块列表

stop_reason
enum<string>

模型停止生成的原因:

  • end_turn:模型自然结束
  • max_tokens:达到 max_tokens 限制
  • tool_use:模型请求工具调用
可用选项:
end_turn,
max_tokens,
tool_use
usage
object

本次请求的 token 用量,包含适用时的 prompt cache 用量。