provider-capability
Baidu ERNIE 语音与音频
直接答案先用本文理解 Baidu ERNIE 的语音与音频能力,再到模型广场核对精确可调用 ID、端点与价格后接入。
更新 · 审核信息
能力边界
Baidu ERNIE 的语音与音频目录描述这一类模型主要解决的任务,不代表所有型号共享相同请求字段、输入限制或输出格式。阅读型号卡片时应同时核对官方状态、原始厂商和来源链接;平台型厂商还可能托管其他厂商的模型,因此型号名称与来源必须一起判断。
选型重点
语音与音频包含语音识别、语音合成、实时对话和音频理解,不能只比较一个质量分数。识别任务关注词错率、时间戳、说话人区分、语言与口音;合成任务关注自然度、音色控制、首包延迟和流式播放;实时对话还要测试打断、回声、噪声、会话状态与工具调用。编码格式、采样率、声道和分片边界必须与端点要求一致。
接入与协议边界
先确认 Baidu ERNIE 官方文档中的精确模型 ID、认证方式、端点和请求结构,再核对本站模型广场中的同名型号与已适配端点。不要只替换 Base URL 就假定响应结构完全相同;流式事件、异步任务、文件上传、工具调用和错误码都可能需要单独适配。
上线检查
使用真实业务样本建立可重复评测,记录模型 ID、参数、输入版本和结果。至少观察成功率、尾延迟、限流、超时、单位任务成本与内容安全,并为预览或即将退役型号准备替代方案。官方目录用于理解产品边界,本站是否可调用、具体价格和渠道状态以模型广场为准。
已核验厂商目录
该能力类型的官方型号
这里展示厂商官方目录中的具体型号,不代表本站一定已开放;可调用 ID、端点和价格请以模型广场为准。
语音与音频
-
audio-realtime-near预览百度端到端语音语言大模型 Pro 近场版本,支持实时文本与语音输出,目前处于公测。
-
audio-realtime-far预览百度端到端语音语言大模型 Pro 远场版本,适合较远距离拾音,目前处于公测。
适用场景
- 语音识别、转录与字幕
- 语音合成、实时对话与音频理解
FAQ
如何选择 Baidu ERNIE 的语音与音频模型?
先明确输入输出与质量目标,再用真实业务样本比较质量、延迟、上下文或媒体限制、工具支持、生命周期状态和单次任务总成本。
官方目录里的型号在本站都能调用吗?
不一定。本文记录厂商官方目录,本站可调用 ID、渠道支持、端点和当前价格仍须以模型广场为准。
上线前至少需要验证什么?
固定精确模型 ID 与端点,验证成功和错误响应,用真实输入测质量与延迟,设置超时和有限重试,并持续关注厂商的弃用公告。
关联指南
官方来源
- 百度智能云千帆模型列表 Official
- 百度智能云千帆模型价格 Official
- 百度智能云千帆 OpenAI SDK 快速开始 Official
- 百度智能云千帆 API Key 鉴权 Official
- 百度智能云千帆文本生成 API Official
- 百度智能云千帆错误码 Official
兔子API