use-case
语音、转写与实时音频 API 指南
直接答案转写、语音合成和实时语音是不同链路,分别关注识别准确率、音色授权与低延迟双工传输,不能用一个音频端点概括。
更新 · 审核信息
三类音频任务
转写把音频变文本,关注语言、时间戳、说话人和噪声;语音合成把文本变音频,关注音色、情感、格式和流式首包;实时对话同时包含采集、VAD、转写、推理与播放。三者的 API 和延迟目标不同。
输入与传输
离线文件要校验格式、采样率、时长和大小,并优先流式上传;实时链路使用 WebRTC、WebSocket 或厂商协议,必须处理重连、背压、打断和会话过期。不要把原始音频写入普通应用日志。
API 选择
转写、Speech 和 Realtime 使用不同模型/端点。本站仅对已适配路径提供 Bearer 认证;模型是否支持语言、时间戳、声音克隆或实时工具调用,以官方页为准。
如何评测
转写使用字/词错误率、专有名词和说话人指标;TTS 评估自然度、可懂度、音色相似和首包;实时语音测端到端延迟、打断成功率与回声。必须覆盖噪声和弱网。
权利与隐私
声音属于敏感生物特征场景。克隆前取得可证明的授权,显著标识合成内容,并核验存储、删除、地域、未成年人和禁止用途政策。
适用场景
- 文本转语音
- 语音转写
- 实时语音
API 协议
/v1/audio/speech/v1/audio/transcriptions/v1/audio/translations
FAQ
语音转写、语音合成和实时对话能共用一个端点吗?
通常不能。转写是音频转文本,TTS 是文本转音频,实时对话还涉及 VAD、双工传输和打断;模型、端点、上传格式及 WebRTC/WebSocket 协议应分别确认。
怎样降低实时语音的延迟和卡顿?
使用服务支持的流式传输,控制音频分片与采样格式,并实现背压、重连、会话过期和打断。分别测首包和端到端延迟,避免在请求链上完整缓冲大文件。
语音模型应该用什么指标评测?
转写评估字/词错误率、术语和说话人;TTS 评估自然度、可懂度、音色相似和首包;实时语音评估端到端延迟、打断和回声。测试集必须包含噪声与弱网。
可以把用户录音写入日志或直接用于声音克隆吗?
不可以默认这样做。原始音频和声音特征可能是敏感数据,应最小化采集、加密存储并支持删除,普通日志只记录脱敏元数据;克隆前还要取得可证明的授权并标识合成内容。
关联指南
官方来源
- OpenAI Audio Guide Official
兔子API