
按类别探索 AI 模型 API
音频与语音模型 API
适用于转录、语音和实时体验的语音识别、文本转语音及音频模型。
10 个可用模型
比较模型 API 价格与能力
打开模型详情页,查看当前价格、端点、上下文限制及相关 API。
Xiaomi
mimo-v2.5-asr
中英双语 + 多方言语音识别,无需语言标签,自动识别语码混用中的各语言内容。支持歌词转写,适应强噪声等复杂声学场景。
上下文 —
按次计费
供应商 1
请求$0.01/请求
Alibaba
qwen3-omni-flash-realtime
千问实时音视频对话模型,可理解文本、图像和音视频输入,并流式输出文本与语音。
上下文 —
按量计费
供应商 2省40%
输入$3.584$2.1504/1M输出$7.168$4.3008/1M
