use-case

语音、转写与实时音频 API 指南

直接答案转写、语音合成和实时语音是不同链路,分别关注识别准确率、音色授权与低延迟双工传输,不能用一个音频端点概括。

更新 · 审核信息

三类音频任务

转写把音频变文本,关注语言、时间戳、说话人和噪声;语音合成把文本变音频,关注音色、情感、格式和流式首包;实时对话同时包含采集、VAD、转写、推理与播放。三者的 API 和延迟目标不同。

输入与传输

离线文件要校验格式、采样率、时长和大小,并优先流式上传;实时链路使用 WebRTC、WebSocket 或厂商协议,必须处理重连、背压、打断和会话过期。不要把原始音频写入普通应用日志。

API 选择

转写、Speech 和 Realtime 使用不同模型/端点。本站仅对已适配路径提供 Bearer 认证;模型是否支持语言、时间戳、声音克隆或实时工具调用,以官方页为准。

如何评测

转写使用字/词错误率、专有名词和说话人指标;TTS 评估自然度、可懂度、音色相似和首包;实时语音测端到端延迟、打断成功率与回声。必须覆盖噪声和弱网。

权利与隐私

声音属于敏感生物特征场景。克隆前取得可证明的授权,显著标识合成内容,并核验存储、删除、地域、未成年人和禁止用途政策。

适用场景

  • 文本转语音
  • 语音转写
  • 实时语音

API 协议

  • /v1/audio/speech
  • /v1/audio/transcriptions
  • /v1/audio/translations

FAQ

语音转写、语音合成和实时对话能共用一个端点吗?

通常不能。转写是音频转文本,TTS 是文本转音频,实时对话还涉及 VAD、双工传输和打断;模型、端点、上传格式及 WebRTC/WebSocket 协议应分别确认。

怎样降低实时语音的延迟和卡顿?

使用服务支持的流式传输,控制音频分片与采样格式,并实现背压、重连、会话过期和打断。分别测首包和端到端延迟,避免在请求链上完整缓冲大文件。

语音模型应该用什么指标评测?

转写评估字/词错误率、术语和说话人;TTS 评估自然度、可懂度、音色相似和首包;实时语音评估端到端延迟、打断和回声。测试集必须包含噪声与弱网。

可以把用户录音写入日志或直接用于声音克隆吗?

不可以默认这样做。原始音频和声音特征可能是敏感数据,应最小化采集、加密存储并支持删除,普通日志只记录脱敏元数据;克隆前还要取得可证明的授权并标识合成内容。

官方来源

  1. OpenAI Audio Guide Official