Skip to main content
POST
语音识别

授权

Authorization
string
header
必填

HTTP: Bearer Auth

  • Security Scheme Type: http
  • HTTP Authorization Scheme: Bearer API_key,用于验证账户信息,可在 账户管理>接口密钥 中查看。

请求头

Content-Type
enum<string>
默认值:multipart/form-data
必填

请求体的媒介类型,固定为 multipart/form-data

可用选项:
multipart/form-data
language
string
默认值:""

可选的 BCP-47 语言标签,用于提示音频中的主要语言。不传该请求头或传空值时,启用混合语言识别。

当前支持:zh(中文)、yue(粤语)、en(英语)、ja(日语)、ko(韩语)、th(泰语)、vi(越南语)、id(印尼语)、ms(马来语)、fil(菲律宾语)、ar(阿拉伯语)、tr(土耳其语)、fr(法语)、de(德语)、es(西班牙语)、it(意大利语)、pt(葡萄牙语)、pl(波兰语)、ru(俄语)和 uk(乌克兰语)。

示例:

"en"

请求体

multipart/form-data
model
enum<string>
默认值:asr-1.0
必填

本次调用的模型版本。

可用选项:
asr-1.0
示例:

"asr-1.0"

file
file
必填

待识别的音频文件,填写文件的路径地址。

上传的音频文件需遵从以下规范:

不支持无容器的裸 PCM 数据。

语音识别不依赖高采样率与立体声,未压缩的高规格音频容易超过大小上限(如 500 秒 48 kHz 立体声 WAV 约 92 MB)。建议先转为单声道 16 kHz,或改用 mp3 / aac / opus 等压缩格式,识别结果不受影响。

response_format
enum<string>
默认值:json

识别结果的返回格式。

verbose_json / srt / vtt 会启用说话人分离与时间戳对齐,因此不能与 stream=true 同时使用

srt 的响应体:

vtt 的响应体:

可用选项:
json,
verbose_json,
srt,
vtt
示例:

"json"

timestamp_level
enum<string>
默认值:""

时间戳粒度。仅当 response_formatverbose_jsonsrtvtt 时生效,因为这些格式会启用说话人分离与时间戳对齐。

  • 空值或 sentence(默认):保持原有句段时间戳,并合并同一分段内相邻且属于同一说话人的文本。
  • word:返回字/词级时间戳,中文按字、英文按词;每个单元仍包含 speaker

response_format=json 时(包括 stream=true 的情况),该参数可以传入,但会被忽略且不会报错。

可用选项:
,
sentence,
word
示例:

"word"

stream
boolean
默认值:false

是否流式返回识别结果。

  • false(默认):识别完成后一次性返回。
  • true:以 SSE 推送增量文本,响应类型为 text/event-stream;此时 response_format 仅支持 json

流式响应以 data: <json> 逐行推送,事件之间以空行分隔:

每个事件的 data 为 JSON 对象:index 为从 0 开始递增的事件序号,delta 为本次新增的识别文本,finish 标识是否为终止事件,duration 为音频时长(单位秒,仅终止事件返回)。客户端应按 index 顺序拼接所有 delta,并在收到 finish=true 后结束读取。

示例:

false

响应

识别成功。response_formatjsonverbose_json 时返回下列 JSON 结构;取 srt / vttstream=true 时的响应体见对应请求参数的说明。

text
string

识别出的完整文本。verbose_json 下等于各 segments[].text 按时间顺序拼接。

duration
number

输入音频的时长,单位为秒。计费以该时长为准。

n_speakers
integer

识别出的说话人数量。response_format=verbose_json 时返回。

segments
object[]

带时间戳的识别单元,每个单元均携带起止时间与说话人标识。粒度由 timestamp_level 决定:默认按句段,设为 word 时中文按字、英文按词。response_format=verbose_json 时返回。

trace_id
string

本次请求的追踪 ID,便于排查问题。