模型介绍
MiniMax 语音识别(ASR)把音频转写成文本,当前对外提供的模型为asr-1.0:
- 多语种混合识别:不指定语种自动识别音频主要语言与中英混合表达,也可通过
language请求头显式指定。 - 一次性 / 流式返回:默认一次性返回;开启
stream=true后以 SSE 逐段推送delta,适合直播字幕、语音助手等对首字延迟敏感的场景。 - 说话人分离:
response_format=verbose_json时返回n_speakers与逐句speaker标签,输出”谁在什么时间说了什么”。 - 精确时间戳与字幕导出:
verbose_json输出逐句起止时间;也可直接以srt/vtt字幕格式返回。 - 稳定性:模型侧针对幻觉做了专项优化,重噪、口语、专业术语等真实场景下的可用性大大提升。
核心能力
verbose_json / srt / vtt 会启用说话人分离与时间戳对齐,不能与 stream=true 同时使用。基础规格
音频文件
ASR 不依赖高采样率与立体声。未压缩高规格音频容易超上限(500 秒 48 kHz 立体声 WAV ≈ 92 MB),建议先转为单声道 16 kHz,或使用
mp3 / aac / opus,识别结果不受影响。支持的语言
不传language(或传空)时启用混合语言识别;语种明确时建议显式指定,短音频与专业术语通常更稳。
返回格式
通过response_format 参数指定,可选取值如下:
流式返回时
response_format 仅支持 json,事件以 data: <json> 逐行推送,字段为 index / delta / finish / duration(duration 仅终止事件返回)。
功能与代码示例
在 账户管理 → 接口密钥 获取 API Key 并写入环境变量MINIMAX_API_KEY。
一次性识别(默认)
指定语种
说话人分离与逐句时间戳
导出 SRT / VTT 字幕
流式识别
错误码
服务采用 OpenAI 风格的错误响应,HTTP 状态码即为错误码,响应体形如{"type":"error","error":{...},"request_id":"..."}。
推荐阅读
语音识别接口
Speech to Text 接口的完整参数、返回结构与错误码。
产品定价
各语音模型的定价说明、计费方式与使用限制。