provider-capability

Google Gemini 语音与音频

直接答案先用本文理解 Google Gemini 的语音与音频能力,再到模型广场核对精确可调用 ID、端点与价格后接入。

更新 · 审核信息

能力边界

Google Gemini 的语音与音频目录描述这一类模型主要解决的任务,不代表所有型号共享相同请求字段、输入限制或输出格式。阅读型号卡片时应同时核对官方状态、原始厂商和来源链接;平台型厂商还可能托管其他厂商的模型,因此型号名称与来源必须一起判断。

选型重点

语音与音频包含语音识别、语音合成、实时对话和音频理解,不能只比较一个质量分数。识别任务关注词错率、时间戳、说话人区分、语言与口音;合成任务关注自然度、音色控制、首包延迟和流式播放;实时对话还要测试打断、回声、噪声、会话状态与工具调用。编码格式、采样率、声道和分片边界必须与端点要求一致。

接入与协议边界

先确认 Google Gemini 官方文档中的精确模型 ID、认证方式、端点和请求结构,再核对本站模型广场中的同名型号与已适配端点。不要只替换 Base URL 就假定响应结构完全相同;流式事件、异步任务、文件上传、工具调用和错误码都可能需要单独适配。

上线检查

使用真实业务样本建立可重复评测,记录模型 ID、参数、输入版本和结果。至少观察成功率、尾延迟、限流、超时、单位任务成本与内容安全,并为预览或即将退役型号准备替代方案。官方目录用于理解产品边界,本站是否可调用、具体价格和渠道状态以模型广场为准。

已核验厂商目录

该能力类型的官方型号

这里展示厂商官方目录中的具体型号,不代表本站一定已开放;可调用 ID、端点和价格请以模型广场为准。

语音与音频

  • gemini-3.1-flash-live-preview 预览

    用于实时双向语音与多模态交互的 Live 预览型号。

    发布时间未在所引官方来源中注明
  • gemini-3.5-live-translate-preview 预览

    支持 70 多种语言的低延迟实时语音到语音翻译预览型号。

    发布时间未在所引官方来源中注明
  • gemini-3.1-flash-tts-preview 预览

    支持可控语音合成的 TTS 预览型号。

    发布时间未在所引官方来源中注明
  • lyria-3-pro-preview 预览

    面向完整歌曲与复杂结构连贯性的旗舰音乐生成预览型号。

    发布时间未在所引官方来源中注明
  • lyria-3-clip-preview 预览

    用于生成最长 30 秒音乐片段、循环和预览的轻量音乐型号。

    发布时间未在所引官方来源中注明
前往模型广场核对实时可用型号

适用场景

  • 语音识别、转录与字幕
  • 语音合成、实时对话与音频理解

FAQ

如何选择 Google Gemini 的语音与音频模型?

先明确输入输出与质量目标,再用真实业务样本比较质量、延迟、上下文或媒体限制、工具支持、生命周期状态和单次任务总成本。

官方目录里的型号在本站都能调用吗?

不一定。本文记录厂商官方目录,本站可调用 ID、渠道支持、端点和当前价格仍须以模型广场为准。

上线前至少需要验证什么?

固定精确模型 ID 与端点,验证成功和错误响应,用真实输入测质量与延迟,设置超时和有限重试,并持续关注厂商的弃用公告。

官方来源

  1. Gemini Models Official
  2. Gemini API Reference Official
  3. Gemini API Getting Started Official
  4. Gemini Interactions API Overview Official
  5. Migrate to the Interactions API Official
  6. Gemini API Streaming Official
  7. Gemini Function Calling Official
  8. Gemini API Key Best Practices Official
  9. Gemini API Errors Official