Skip to main content
POST
✨ 全新模型 MiniMax-M3.1-Flash-Preview核心能力:1M 超长上下文、多模态、思考深度可调。暂时仅通过 Token Plan 和 MiniMax Code 提供。
MiniMax-M3.1-Flash-Preview 新特性:
  1. 支持图片、视频理解,可参考右方示例代码
  2. 支持通过 reasoning_effort 调节思考深度,可取 low、medium、high、xhigh、max,默认档位为 max
  3. 深度思考默认开启,无需额外配置;思考内容通过 reasoning_content 字段单独返回

授权

Authorization
string
header
必填

HTTP: Bearer Auth

  • Security Scheme Type: http
  • HTTP Authorization Scheme: Bearer API_key,用于验证账户信息,可在 账户管理>接口密钥 中查看

请求头

Content-Type
enum<string>
默认值:application/json
必填

请求体的媒介类型,请设置为 application/json,确保请求数据的格式为 JSON

可用选项:
application/json

请求体

application/json
model
enum<string>
必填

模型 ID

可用选项:
MiniMax-M3.1-Flash-Preview,
MiniMax-M3,
MiniMax-M2.7,
MiniMax-M2.7-highspeed,
MiniMax-M2.5,
MiniMax-M2.5-highspeed,
MiniMax-M2.1,
MiniMax-M2.1-highspeed,
MiniMax-M2
messages
object[]
必填

包含对话历史的消息列表。支持文本、图片、视频和工具调用。

service_tier
enum<string>
默认值:standard

请求准入服务层级。支持的取值为 standard 和 priority。省略时默认使用 standard。priority 的价格为 standard 的 1.5 倍,并会确保请求获得优先准入,使其排在其他请求之前处理,从而带来更快响应并减少失败。

可用选项:
standard,
priority
thinking
object

控制 thinking 行为。adaptive 这个默认值对所有模型都生效,差异只在 disabled 的效果上。

  • MiniMax-M3.1-Flash-Preview:强制开启 thinking。传入 disabled 会返回 HTTP 400。如需调节思考深度,请使用 reasoning_effort。
  • MiniMax-M3:默认开启 adaptive thinking;传入 disabled 会跳过 thinking 直接回答。
  • M2.x 模型:thinking 无法关闭,传入 disabled 会被接收但不生效。
reasoning_effort
enum<string>

调节思考深度。仅 MiniMax-M3.1-Flash-Preview 支持真正的思考深度调节,其他模型会忽略该字段。省略时,该模型的默认思考深度为 max。由于 MiniMax-M3.1-Flash-Preview 强制开启 thinking,不接受 none,传入会返回 HTTP 400。

可用选项:
low,
medium,
high,
xhigh,
max
reasoning_split
boolean

输出格式开关。为 true 时将 thinking 内容拆分到 reasoning_content 字段;为 false 时 thinking 以 <think> 标签保留在 content 字段内。MiniMax-M3.1-Flash-Preview 暂不支持将该参数设为 false。该参数不会开启或关闭 thinking。

stream
boolean
默认值:false

是否使用流式传输,默认为 false。设置为 true 后,响应将分批返回。

stream_options
object

流式响应选项。

max_completion_tokens
integer<int64>

指定生成内容长度的上限(Token 数)。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 推荐值为 131072(128K),上限为 524288(512K);其他模型推荐值为 65536(64K),上限为 204800(200K)。如果生成因 length 原因中断,请尝试调高此值。

必填范围: x >= 1
temperature
number<double>
默认值:1

温度系数,影响输出随机性,取值范围 [0, 2],默认值为 1。值越高,输出越随机;值越低,输出越确定。

必填范围: 0 <= x <= 2
top_p
number<double>
默认值:0.95

核采样参数,取值范围 [0, 1]。MiniMax-M3.1-Flash-Preview 和 MiniMax-M3 默认值为 0.95,M2.x 系列模型默认值为 0.9。

必填范围: 0 <= x <= 1
tools
object[]

工具定义列表,当前支持 function 工具。

max_tokens
integer<int64>
已弃用

旧版生成长度限制参数。已弃用,请改用 max_completion_tokens。

必填范围: x >= 1

响应

id
string

本次响应的唯一 ID

choices
object[]

响应选择列表

created
integer<int64>

响应创建的 Unix 时间戳(秒)

model
string

本次请求使用的模型 ID

object
enum<string>

对象类型。非流式为 chat.completion,流式为 chat.completion.chunk

可用选项:
chat.completion,
chat.completion.chunk
usage
object

本次请求的 Token 使用情况统计

input_sensitive
boolean

输入内容是否命中敏感词。如果输入内容严重违规,接口会返回内容违规错误信息,回复内容为空

input_sensitive_type
integer<int64>

输入命中敏感词类型,当input_sensitive为true时返回。取值为以下其一:1 严重违规;2 色情;3 广告;4 违禁;5 谩骂;6 暴恐;7 其他

output_sensitive
boolean

输出内容是否命中敏感词。如果输出内容严重违规,接口会返回内容违规错误信息,回复内容为空

output_sensitive_type
integer<int64>

输出命中敏感词类型

base_resp
object

错误状态码和详情