获取 API Key
-
按量付费:通过 接口密钥 > 创建新的 API Key,获取 API Key
按量付费支持使用所有模态模型,包括语言、视频、语音、图像等
-
Token Plan:通过 订阅管理 > Token Plan,查看 订阅 Key
订阅 Key 用于 Token Plan 订阅套餐和已购积分,并与按量计费 API Key 相互独立。详情见 Token Plan 概要
语言模型
语言模型接口使用 MiniMax M3,MiniMax M2.7,MiniMax M2.7-highspeed,MiniMax M2.5,MiniMax M2.5-highspeed,MiniMax M2.1,MiniMax M2.1-highspeed,MiniMax M2 根据输入的上下文,让模型生成对话内容、工具调用。 可通过 HTTP 请求、Anthropic SDK(推荐) 或 OpenAI SDK 接入。 支持模型
如果在使用模型过程中遇到任何问题:
- 通过邮箱 Model@minimaxi.com 等官方渠道联系我们的技术支持团队
- 在我们的 Github 仓库提交Issue
Anthropic API 兼容(推荐)
通过 Anthropic SDK 调用 MiniMax 模型
OpenAI API 兼容
通过 OpenAI SDK 调用 MiniMax 模型
MiniMax-H3 <NEW>
本接口基于 MiniMax-H3 模型,支持文本、图片、视频、音频等多模态输入进行视频生成,覆盖文生视频、图生视频、首尾帧生成视频、多模态参考生视频等场景。 支持模型
接口说明
MiniMax-H3 任务采用异步方式,提供创建视频生成任务、创建 H3-Context-IR 任务和创建视频再生成任务三个创建入口,并共用查询、列表以及取消或删除接口。使用步骤如下:
- 根据场景创建视频生成任务,使用相同的多模态输入创建 H3-Context-IR 任务,或对符合 MiniMax-H3 768P 输出规格的源视频创建视频再生成任务;再生成请求必须且只能包含一个
role=base_video的源视频项。成功后均返回task_id。 - 使用查询任务接口按
task_id获取状态与结果;视频任务成功后从content.url获取成片地址,H3-Context-IR 任务成功后从content.prompt获取增强提示词。也可以使用查询任务列表接口批量查看,并通过task_type区分generation、h3_context_ir与regeneration。 - 对排队中的任务,可使用取消或删除任务接口取消;对成功或失败的任务,可使用同一接口删除任务记录。
创建视频生成任务
基于多模态 content 输入创建视频生成任务
创建 H3-Context-IR 任务
深度理解视频生成的多模态上下文并生成结构化增强提示词
创建视频再生成任务
将符合 MiniMax-H3 768P 输出规格的视频再生成为 2K 视频
查询任务
按 task_id 查询任务状态并获取成片下载地址
查询任务列表
分页查询最近 7 天内的任务并按任务类型过滤
取消或删除任务
取消排队中的任务,或删除成功和失败的任务记录
同步语音合成
本接口支持基于文本到语音的同步生成,单次可处理最长 10,000 字符 的文本。 接口本身为无状态接口,即单次调用时,模型仅处理单次传入内容,不涉及业务逻辑,同时模型也不存储您传入的数据。 该接口支持以下功能:- 支持 300+ 系统音色、复刻音色自主选择;
- 支持音量、语调、语速、输出格式调整;
- 支持按比例混音功能;
- 支持固定间隔时间控制;
- 支持多种音频规格、格式,包括:mp3, pcm, flac, wav;
- 支持流式输出。
接口说明
同步语音合成功能,共包含 2 个接口,可根据需求,选择使用。
- HTTP 同步语音合成
- WebSocket 同步语音合成
支持语言
MiniMax 的语音合成模型具备卓越的跨语言能力,全面支持 40 种全球广泛使用的语言。我们致力于打破语言壁垒,构建真正意义上的全球通用人工智能模型。 目前支持的语言包含:HTTP 同步语音合成
通过 HTTP 请求进行语音合成
WebSocket 同步语音合成
通过 WebSocket 进行流式语音合成
异步长文本语音生成
该 API 支持基于文本到语音的异步生成,单次文本生成传输最大支持 100 万字符,生成的完整音频结果支持异步的方式进行检索。 该接口支持以下功能:- 支持 100+系统音色、复刻音色自主选择;
- 支持语调、语速、音量、比特率、采样率、输出格式自主调整;
- 支持音频时长、音频大小等返回参数;
- 支持时间戳(字幕)返回,精确到句;
- 支持直接传入字符串与上传文本文件 file_id 两种方式进行待合成文本的输入;
- 支持非法字符检测:非法字符不超过 10%(包含 10%),音频会正常生成并返回非法字符占比;非法字符超过 10%,接口不返回结果(返回报错码),请检测后再次进行请求【非法字符定义:ascii 码中的控制符(不含制表符和换行符)】。
接口说明
整体包含 2 个 API:创建语音生成任务、查询语音生成任务状态。使用步骤如下:
- 创建语音生成任务得到 task_id(如果选择以 file_id 的形式传入待合成文本,需要前置使用 File(Upload)接口进行文件上传);
- 基于 taskid 查询语音生成任务状态;
- 如果发现任务生成成功,那么可以使用本接口返回的 file_id 通过 File API 进行结果查看和下载。
创建异步语音任务
创建长文本语音生成任务
查询任务状态
查询语音生成任务状态
音色快速复刻
本接口支持基于用户上传需要复刻音频的音频,以及示例音频,进行音色的复刻。 使用本接口需要完成个人认证及企业认证用户后,方可调用。 请在 账户管理 -> 账户信息 中,完成个人用户认证或企业用户认证,以确保可以正常使用本功能。 本接口适用场景:IP 音色复刻、音色克隆等需要快速复刻某一音色的相关场景。 本接口支持单、双声道复刻声音,支持按照指定音频文件快速复刻相同音色的语音。 支持模型 以下为 MiniMax 提供的语音模型及其特性说明。
接口说明
- 上传待克隆音频 调用 上传复刻音频 上传待克隆的音频文件并获取
file_id。 - 上传示例音频 (可选) 若需要提供示例音频以增强克隆效果,需要再次调用 上传示例音频 上传示例音频文件并获得对应的
file_id。填写在clone_prompt中的prompt_audio中。 - 调用复刻接口 基于获取的
file_id和自定义的voice_id作为输入参数,调用 快速复刻 克隆音色。
注意事项
- 调用本接口进行音色克隆时,不会立即收取音色复刻费用。音色的复刻费用将在首次使用此复刻音色进行语音合成时收取(不包含本接口内的试听行为)。
- 本接口产出的快速复刻音色为临时音色,若希望永久保留某复刻音色,请于 168 小时(7 天)内在任意 T2A 语音合成接口中调用该音色(不包含本接口内的试听行为)。若超过时限,该音色将被删除。
- 接口采用无状态设计:每次调用仅处理传入数据,且不存储用户上传内容,不涉及任何业务逻辑状态。
上传复刻音频
上传待克隆的音频文件
快速复刻
执行音色克隆
音色设计
该 API 支持基于用户输入的声音描述 prompt,生成个性化定制音色。 本接口支持使用生成的音色(voice_id)在同步语音合成接口和异步长文本语音合成接口中进行语音生成 支持模型推荐使用 speech-02-hd 以获得最佳效果
注意事项
- 调用本接口获得音色时,不会立即收取生成音色的费用,生成音色的费用将在首次使用此音色进行语音合成时收取(不包含本接口内的试听行为)。
- 本接口产出的音色为临时音色,如您希望永久保留某音色,请于 168 小时(7 天)内在任意语音合成接口中调用该音色(不包含本接口内的试听行为),超过有效期未被使用的音色将自动删除。
音色设计接口
基于描述生成个性化音色
图像生成
本接口支持基于用户提供的文本或参考图片,进行创意图像生成。支持设置不同图片比例和长宽像素设置,满足不同场景下图像需求。 接口说明 通过创建图片生成任务接口,使用文本描述和参考图片,进行图像生成。 模型列表文生图
基于文本描述生成图像
图生图
基于参考图片生成图像
音乐生成
本接口根据歌曲描述(prompt)和歌词(lyrics),生成一首人声的歌曲。 支持模型音乐生成接口
根据描述和歌词生成音乐
文件管理
本接口是作为文件管理接口,配合 MiniMax 开放平台的其他接口使用。 接口说明 本接口是作为文件管理接口,配合其他接口使用。共包含 5 个接口:上传、列出、检索、下载、删除。 文件的支持格式、容量及大小限制以上传文件接口文档为准,详见 上传文件。上传文件
上传文件到平台
文件列表
获取已上传的文件列表