use-case

豆包计费:在线、Fast、批量与缓存

直接答案在线适合即时交互,Fast 是受模型与渠道支持约束的低延迟服务档位,批量是独立的上游推理服务;普通并发不会自动享受批量价。费用还要结合输入长度、音频、缓存和当前分组核对。

更新 · 审核信息

小白:先选模型,再选服务

Pro、Turbo、Lite、Mini 是模型型号;在线、Fast、批量是推理服务或计费场景,两者不是同一个维度。下表用于理解选择方式,不承诺每个型号、地域和渠道都支持所有场景。

场景适合的任务计费与接入前提
在线推理聊天、客服、交互式 Agent使用常规在线服务,按该模型在线场景结算
低延迟(Fast)对响应速度更敏感的交互模型与渠道支持低延迟档位,使用独立价格配置
批量推理可等待的翻译、摘要、标注、离线评测使用专门的上游批量服务;等待更久以换取适合批处理的成本与吞吐

批量价不等于所有项目统一打折。输入、输出、缓存命中和音频要逐项核对,不能因为输入输出更便宜,就把缓存也乘同一折扣。具体支持范围与上游价格查看本页官方来源;本站可用模型、端点和当前售价查看模型广场。本页不复制一份会随调价过期的售价表。

批量不是“同时发很多在线请求”

并发调用 /v1/chat/completions、使用 asyncioPromise.all、设置 stream: false,或者把多条任务放进一个提示词,都不会自动成为上游批量推理。客户端是否异步、响应是否流式,与服务端采用哪种计费场景是不同问题。

火山引擎官方 SDK 示例使用专用的 client.batch.chat.completions.create。这是直连方舟的示例,不是本站 SDK 接口;也不能据此断言批量一定要求上传文件或一定在某个固定时限完成。

当前豆包适配包含批量价格分支,但未因此新增公开批量提交、查询或下载接口。批量身份只能由受信任的服务端作业流程确认;客户端添加 batch: true、请求头或 service_tier: "batch" 不能获得批量折扣。使用前先查看端点矩阵,不要猜测批量路由。异步任务指南中的媒体任务也不等同于豆包文本批量服务。

Fast 如何判定

当前豆包计费适配根据渠道过滤、参数覆盖后,发往上游请求的 service_tier: "fast" 判定 Fast 场景,并在请求计费快照中固定。只在原始客户端请求中写了 Fast,但被渠道移除,不会据此触发 Fast 分支。支持该字段不等于所有模型都提供 Fast 服务,成功转发也不等于承诺固定延迟。

不要因为模型名含 Turbo 就自动按 Fast 收费,也不要把某一模型 Fast 文本价格的涨幅套到另一模型或音频项。没有独立列出的场景或项目,应核实官方说明与渠道能力,不能自行推算。

输入、音频与缓存:同一 token 不重复收费

下列拆分适用于启用了相应独立价格、且上游 usage 提供完整明细的豆包配置。输入总量可能已经包含音频和缓存,不能把所有原始计数直接相加。

计价项核对方式
普通推理输入从总输入中排除已单独计价的缓存、音频等部分
文本缓存命中缓存总命中减去其中的音频缓存命中
音频输入音频总输入减去其中的音频缓存命中
音频输入(命中缓存)音频与缓存的交集,只计入这一项
推理输出按响应输出用量核对,不混入输入项
缓存存储保留 token 数乘计费小时数,与缓存读取、写入分开

示例:总输入 10000 token,缓存总命中 2000,音频总输入 1000,其中音频缓存命中 200。排除其他独立计价项后,四项分别为普通输入 7200、文本缓存 1800、未缓存音频 800、音频缓存 200,合计仍为 10000。缺少音频缓存明细时不能凭空推断交集。

token 费用 = Σ(各不重叠类别的 token 数 × 该场景单价) / 1000000
存储费用 = 实际保留 token 数 × 计费小时数 × 存储单价 / 1000000

例如保留 100000 token 两小时,对应 200000 token·小时,不是一次写入 100000 token 的费用。存储项必须有实际计量依据;没有存储明细时不能由缓存命中量补出一小时费用。以上公式只解释单价与用量关系,本站最终结算还要核对生效价格方案、币种和适用分组。

长度分档:看完整输入,不看扣除缓存后的输入

当前 Mini 表单用 len 表示完整输入长度,32k 和 128k 的边界分别是 32000、128000 token:恰好等于边界时归入前一档,超过边界进入下一档。界面第三档为 128k–256k;这不是“超过 256k 才开始”的档位,也不构成支持超过模型上下文上限的承诺。定价条件不是请求长度校验器,允许的输入和输出上限仍需查看具体模型版本。

例如完整输入 40000 token,其中 30000 命中缓存,仍按 32k–128k 的档位选择各项单价,不能按剩下的 10000 token 选择最低档。这里是按区间选取整次请求的单价,不是把前 32000 和后续部分做累进计价。不要把一个 Mini 版本的区间套到整个豆包家族。

管理员:填写、保存与回读

具备管理员权限后,进入模型定价设置,选择精确模型名和“按量计费”。在已适配型号中,“按场景计费价格”按在线、Fast、批量展示独立项目;Mini 还按输入长度分档。未适用的项目不会因为同属豆包就自动出现。

  1. 先确认精确模型版本与币种。所有输入框以当前显示币种为准,普通项单位为每百万 tokens,存储项为每百万 token·小时。
  2. 已有基础价格只回填已有项目,不代表其他场景已配置。逐项填写,或点击“填入参考价格”载入本地草稿,再核对官方价格。内置参考值不是实时同步;其基准按 1 USD = 7 CNY 换算,不能把它当成实时汇率或直接保证本站售价等于官方人民币价。
  3. 空白代表未设置,免费项明确填 0。核对所有档位后点击保存;仅编辑或载入参考价格不会立即生效。
  4. 保存后重新打开同一模型,确认各场景、币种和长度档位回读一致。该表单会保存为统一的多档位计费规则;“按量计费(多档位)”不是重复叠加两套账单。
  5. 如已有自定义表达式无法无损映射到表单,应继续通过表达式编辑器核对;不要为了显示输入框而覆盖原规则。若完全看不到新字段,先确认部署版本包含该表单及模型名是否精确匹配,再排查页面资源缓存。

公共模型价格与分组专属方案需要分别核对,不能假定修改公共价格就覆盖所有分组。后台“批量应用当前模型价格”只是把配置复制到多个模型,与批量推理服务无关。配置批量价格也不会开通上游服务或创建批量作业。

精调与训练不属于普通推理账单

全量精调、LoRA 精调是训练费用;精调后的文本、音频推理是另外的模型或 Endpoint 计价。不能把训练单价附加到基础模型的每次调用,也不能把精调后推理价覆盖到基础型号。本次推理计费适配不代表已提供训练任务接口或自动训练结算。

专家:按请求与价格快照对账

小规模验证在线请求与实际支持的 Fast 请求,并核对消费日志中的命中档位、用量和最终结算。批量分支应先在离线测试或正式接入的受信任批量流程中验证,不能伪造客户端字段测试优惠。建议保存以下对账字段;这是业务账本建议,并非要求响应一定返回全部字段:

request_id, original_model, upstream_model, endpoint, group,
effective_service_tier, matched_tier, full_input_tokens,
text_input_tokens, text_cached_tokens, audio_input_tokens,
audio_cached_tokens, output_tokens, cache_storage_token_hours,
pricing_version, currency, final_charge

预扣金额可能先按估算产生,完成后应以实际用量和冻结的价格规则核对;不要用今天的价格重算历史请求。更完整的退款、重试与成本核对见计费、用量与成本核对

适用场景

  • 选择推理服务并预估费用
  • 配置豆包多场景价格并核对消费日志

FAQ

同时发送很多请求就会按批量价收费吗?

不会。普通 Chat 请求即使并发发送、使用异步代码或关闭流式,也仍是在线调用。批量价需要真正接入上游批量服务,且由服务端确认作业身份。

Turbo 就是 Fast 吗?

不是。Turbo 是模型型号,Fast 是服务档位;选择 Turbo 不会自动启用 Fast,也不能假定 Pro、Lite、Mini 的 Fast 能力与价格相同。

为什么缓存命中很多,仍然使用较高的长度档位?

档位依据完整输入长度,包含命中的上下文。命中减少的是按普通输入价计费的 token,不是用于选择档位的输入总长度。

音频命中缓存是否同时收音频输入和缓存命中费?

在启用音频缓存独立定价且上游提供相应明细时,同一部分 token 只落入音频缓存项,不能再重复加入普通音频、文本缓存或普通输入项。

填入参考价格后会立即生效吗?

不会。它只更新编辑草稿,必须核对币种、场景和所有必填项后点击保存。空白表示未配置;只有明确填写 0 才表示免费。

有缓存存储单价就会自动按一小时收费吗?

不会。存储费需要实际保留 token 数与计费时长;不能把缓存命中或缓存写入量当成 token·小时,也不能在没有计量依据时假定一小时。

官方来源

  1. 火山方舟批量推理 Official
  2. Volcengine Python SDK — Batch Chat Completions Official
  3. Doubao Seed 2.1 Pro — 官方模型与价格 Official
  4. Doubao Seed 2.1 Turbo — 官方模型与价格 Official
  5. Doubao Seed 2.0 Lite — 官方模型与价格 Official
  6. Doubao Seed 2.0 Mini — 官方模型与价格 Official