Skip to main content
若需要使用语音识别能力,请点击 按量购买 API,或 订阅 Token Plan。

模型介绍

MiniMax 语音识别(ASR)把音频转写成文本,当前对外提供的模型为 asr-1.0:
  • 多语种混合识别:不指定语种自动识别音频主要语言与中英混合表达,也可通过 language 请求头显式指定。
  • 一次性 / 流式返回:默认一次性返回;开启 stream=true 后以 SSE 逐段推送 delta,适合直播字幕、语音助手等对首字延迟敏感的场景。
  • 说话人分离:response_format=verbose_json 时返回 n_speakers 与逐句 speaker 标签,输出”谁在什么时间说了什么”。
  • 精确时间戳与字幕导出:verbose_json 输出逐句起止时间;也可直接以 srt / vtt 字幕格式返回。
  • 稳定性:模型侧针对幻觉做了专项优化,重噪、口语、专业术语等真实场景下的可用性大大提升。

核心能力

verbose_json / srt / vtt 会启用说话人分离与时间戳对齐,不能与 stream=true 同时使用。

基础规格

音频文件

ASR 不依赖高采样率与立体声。未压缩高规格音频容易超上限(500 秒 48 kHz 立体声 WAV ≈ 92 MB),建议先转为单声道 16 kHz,或使用 mp3 / aac / opus,识别结果不受影响。

支持的语言

不传 language(或传空)时启用混合语言识别;语种明确时建议显式指定,短音频与专业术语通常更稳。

返回格式

通过 response_format 参数指定,可选取值如下: 流式返回时 response_format 仅支持 json,事件以 data: <json> 逐行推送,字段为 index / delta / finish / duration(duration 仅终止事件返回)。

功能与代码示例

在 账户管理 → 接口密钥 获取 API Key 并写入环境变量 MINIMAX_API_KEY。

一次性识别(默认)

指定语种

说话人分离与逐句时间戳

返回示例:

导出 SRT / VTT 字幕

流式识别

推送格式(事件之间以空行分隔):

错误码

服务采用 OpenAI 风格的错误响应,HTTP 状态码即为错误码,响应体形如 {"type":"error","error":{...},"request_id":"..."}。

推荐阅读

语音识别接口

Speech to Text 接口的完整参数、返回结构与错误码。

产品定价

各语音模型的定价说明、计费方式与使用限制。