Skip to main content

获取 API Key


语言模型

语言模型接口使用 MiniMax M3MiniMax M2.7MiniMax M2.7-highspeedMiniMax M2.5MiniMax M2.5-highspeedMiniMax M2.1MiniMax M2.1-highspeedMiniMax M2 根据输入的上下文,让模型生成对话内容、工具调用。 可通过 HTTP 请求、Anthropic SDK(推荐) 或 OpenAI SDK 接入。 支持模型 如果在使用模型过程中遇到任何问题:
  • 通过邮箱 Model@minimaxi.com 等官方渠道联系我们的技术支持团队
  • 在我们的 Github 仓库提交Issue

Anthropic API 兼容(推荐)

通过 Anthropic SDK 调用 MiniMax 模型

OpenAI API 兼容

通过 OpenAI SDK 调用 MiniMax 模型

MiniMax-H3 <NEW>

本接口基于 MiniMax-H3 模型,支持文本、图片、视频、音频等多模态输入进行视频生成,覆盖文生视频、图生视频、首尾帧生成视频、多模态参考生视频等场景。 支持模型 接口说明 MiniMax-H3 任务采用异步方式,提供创建视频生成任务创建 H3-Context-IR 任务创建视频再生成任务三个创建入口,并共用查询、列表以及取消或删除接口。使用步骤如下:
  1. 根据场景创建视频生成任务,使用相同的多模态输入创建 H3-Context-IR 任务,或对符合 MiniMax-H3 768P 输出规格的源视频创建视频再生成任务;再生成请求必须且只能包含一个 role=base_video 的源视频项。成功后均返回 task_id
  2. 使用查询任务接口按 task_id 获取状态与结果;视频任务成功后从 content.url 获取成片地址,H3-Context-IR 任务成功后从 content.prompt 获取增强提示词。也可以使用查询任务列表接口批量查看,并通过 task_type 区分 generationh3_context_irregeneration
  3. 对排队中的任务,可使用取消或删除任务接口取消;对成功或失败的任务,可使用同一接口删除任务记录。

创建视频生成任务

基于多模态 content 输入创建视频生成任务

创建 H3-Context-IR 任务

深度理解视频生成的多模态上下文并生成结构化增强提示词

创建视频再生成任务

将符合 MiniMax-H3 768P 输出规格的视频再生成为 2K 视频

查询任务

按 task_id 查询任务状态并获取成片下载地址

查询任务列表

分页查询最近 7 天内的任务并按任务类型过滤

取消或删除任务

取消排队中的任务,或删除成功和失败的任务记录

同步语音合成

本接口支持基于文本到语音的同步生成,单次可处理最长 10,000 字符 的文本。 接口本身为无状态接口,即单次调用时,模型仅处理单次传入内容,不涉及业务逻辑,同时模型也不存储您传入的数据。 该接口支持以下功能:
  1. 支持 300+ 系统音色、复刻音色自主选择;
  2. 支持音量、语调、语速、输出格式调整;
  3. 支持按比例混音功能;
  4. 支持固定间隔时间控制;
  5. 支持多种音频规格、格式,包括:mp3, pcm, flac, wav;
  6. 支持流式输出。
支持模型 以下为 MiniMax 提供的语音模型及其特性说明。 接口说明 同步语音合成功能,共包含 2 个接口,可根据需求,选择使用。
  • HTTP 同步语音合成
  • WebSocket 同步语音合成

支持语言

MiniMax 的语音合成模型具备卓越的跨语言能力,全面支持 40 种全球广泛使用的语言。我们致力于打破语言壁垒,构建真正意义上的全球通用人工智能模型。 目前支持的语言包含:

HTTP 同步语音合成

通过 HTTP 请求进行语音合成

WebSocket 同步语音合成

通过 WebSocket 进行流式语音合成

异步长文本语音生成

该 API 支持基于文本到语音的异步生成,单次文本生成传输最大支持 100 万字符,生成的完整音频结果支持异步的方式进行检索。 该接口支持以下功能:
  1. 支持 100+系统音色、复刻音色自主选择;
  2. 支持语调、语速、音量、比特率、采样率、输出格式自主调整;
  3. 支持音频时长、音频大小等返回参数;
  4. 支持时间戳(字幕)返回,精确到句;
  5. 支持直接传入字符串与上传文本文件 file_id 两种方式进行待合成文本的输入;
  6. 支持非法字符检测:非法字符不超过 10%(包含 10%),音频会正常生成并返回非法字符占比;非法字符超过 10%,接口不返回结果(返回报错码),请检测后再次进行请求【非法字符定义:ascii 码中的控制符(不含制表符和换行符)】。
提交长文本语音合成请求后,会生成 file_id,生成任务完成后,可通过 file_id 使用文件检索接口进行下载。 ⚠️ 注意:返回的 url 的有效期为:自 url 返回开始的 9 个小时(即 32400 秒),超过有效期后 url 便会失效,生成的信息便会丢失,请注意下载信息的时间。 适用场景:整本书籍等长文本的语音生成。 支持模型 以下为 MiniMax 提供的语音模型及其特性说明。 接口说明 整体包含 2 个 API:创建语音生成任务查询语音生成任务状态。使用步骤如下:
  1. 创建语音生成任务得到 task_id(如果选择以 file_id 的形式传入待合成文本,需要前置使用 File(Upload)接口进行文件上传);
  2. 基于 taskid 查询语音生成任务状态;
  3. 如果发现任务生成成功,那么可以使用本接口返回的 file_id 通过 File API 进行结果查看和下载。

创建异步语音任务

创建长文本语音生成任务

查询任务状态

查询语音生成任务状态

音色快速复刻

本接口支持基于用户上传需要复刻音频的音频,以及示例音频,进行音色的复刻。 使用本接口需要完成个人认证及企业认证用户后,方可调用。 请在 账户管理 -> 账户信息 中,完成个人用户认证或企业用户认证,以确保可以正常使用本功能。 本接口适用场景:IP 音色复刻、音色克隆等需要快速复刻某一音色的相关场景。 本接口支持单、双声道复刻声音,支持按照指定音频文件快速复刻相同音色的语音。 支持模型 以下为 MiniMax 提供的语音模型及其特性说明。 接口说明
  1. 上传待克隆音频 调用 上传复刻音频 上传待克隆的音频文件并获取 file_id
  2. 上传示例音频 (可选) 若需要提供示例音频以增强克隆效果,需要再次调用 上传示例音频 上传示例音频文件并获得对应的 file_id。填写在clone_prompt中的prompt_audio中。
  3. 调用复刻接口 基于获取的 file_id 和自定义的 voice_id 作为输入参数,调用 快速复刻 克隆音色。

注意事项

  • 调用本接口进行音色克隆时,不会立即收取音色复刻费用。音色的复刻费用将在首次使用此复刻音色进行语音合成时收取(不包含本接口内的试听行为)。
  • 本接口产出的快速复刻音色为临时音色,若希望永久保留某复刻音色,请于 168 小时(7 天)内在任意 T2A 语音合成接口中调用该音色(不包含本接口内的试听行为)。若超过时限,该音色将被删除。
  • 接口采用无状态设计:每次调用仅处理传入数据,且不存储用户上传内容,不涉及任何业务逻辑状态。

上传复刻音频

上传待克隆的音频文件

快速复刻

执行音色克隆

音色设计

该 API 支持基于用户输入的声音描述 prompt,生成个性化定制音色。 本接口支持使用生成的音色(voice_id)在同步语音合成接口异步长文本语音合成接口中进行语音生成 支持模型
推荐使用 speech-02-hd 以获得最佳效果

注意事项

  • 调用本接口获得音色时,不会立即收取生成音色的费用,生成音色的费用将在首次使用此音色进行语音合成时收取(不包含本接口内的试听行为)。
  • 本接口产出的音色为临时音色,如您希望永久保留某音色,请于 168 小时(7 天)内在任意语音合成接口中调用该音色(不包含本接口内的试听行为),超过有效期未被使用的音色将自动删除。

音色设计接口

基于描述生成个性化音色

图像生成

本接口支持基于用户提供的文本或参考图片,进行创意图像生成。支持设置不同图片比例和长宽像素设置,满足不同场景下图像需求。 接口说明 通过创建图片生成任务接口,使用文本描述和参考图片,进行图像生成。 模型列表

文生图

基于文本描述生成图像

图生图

基于参考图片生成图像

音乐生成

本接口根据歌曲描述(prompt)和歌词(lyrics),生成一首人声的歌曲。 支持模型

音乐生成接口

根据描述和歌词生成音乐

文件管理

本接口是作为文件管理接口,配合 MiniMax 开放平台的其他接口使用。 接口说明 本接口是作为文件管理接口,配合其他接口使用。共包含 5 个接口:上传列出检索下载删除 文件的支持格式、容量及大小限制以上传文件接口文档为准,详见 上传文件

上传文件

上传文件到平台

文件列表

获取已上传的文件列表

官方 MCP

MiniMax 提供官方的 Python 版本JavaScript 版本 模型上下文协议(MCP)服务器实现代码,支持语音合成、音色克隆、视频生成、音乐生成等功能,详细说明请参考 MiniMax MCP 使用指南

语音调试台

语音合成调试台

音色快速复刻调试台