provider
Cohere
直接答案Cohere 新直连项目使用原生 POST /v2/chat;本站 /v1/chat/completions 是已适配渠道的 OpenAI 兼容入口,并非 Cohere 原生路径。Embed 必须正确选择 input_type 与维度,Rerank、Trial/Production 限流和模型退役也需分别核验。
更新 · 审核信息
先区分 Cohere 原生 V2 与本站兼容入口
Cohere 的新原生对话接口是 POST https://api.cohere.com/v2/chat,使用 Cohere 的 Bearer Key、必填 model 和按时间顺序排列的 messages,响应采用 Cohere V2 内容结构。本站 /v1/chat/completions 则接收 OpenAI 兼容请求并转到配置好的 Cohere 渠道;它不是 Cohere 官方 URL,也没有在本站暴露 /v2/chat。
Embed 的 input_type 决定向量用途
Cohere V3 及以上 Embed 模型要求 input_type。构建检索库时,文档使用 search_document,线上查询使用 search_query;分类、聚类和图像也有各自类型。Embed v4 及更新模型可用 output_dimension 选择 256、512、1024 或 1536 维,默认 1536。模型、维度或向量类型变化时,应重建或并行迁移索引。本站本页未列出 Embeddings 路径,不能把 Cohere /v2/embed 冒充本站入口。
Rerank 是召回后的第二阶段
Rerank 接收一个 query 和候选 documents,返回原文档 index 与 relevance_score,适合在关键词或向量召回后压缩候选集。Cohere 原生 V2 路径为 /v2/rerank;本站已适配 /v1/rerank,但客户端应分别遵守两边的认证与响应契约。长文档可能被截断或分块,评测应覆盖排序质量、延迟和 search units 成本。
Trial 与 Production 限流按端点拆分
Cohere 没有一个适用于所有能力的统一 QPS。官方当前表格对常见 Command Chat 列出 Trial 20 次/分钟与 Production 500 次/分钟,对 Rerank 列出 10 与 1000 次/分钟;文本 Embed 则按 inputs 计,两类 Key 都是每分钟 2000 个 inputs。某些新 Chat 型号的 Production 额度需要联系销售,Trial 和部分新型号还有每月调用上限。收到 429 时先确认具体模型、端点、分钟或月度配额,再做有界退避。
模型退役会让旧 ID 直接失败
Cohere 的 Deprecations 页面按日期列出退役模型、端点和替代项。Embed v2.0 与部分 Aya 8B ID 已在 2026-04-04 退役,旧请求会失败。迁移 Chat 还要注意 V2 把历史合并到 messages,且 model 成为必填;迁移 Embed 必须同步验证 embedding_types、input_type、维度和向量索引,不能仅替换模型名。
已核验厂商目录
按能力类型查看最新模型
这里展示厂商官方目录中的具体型号,不代表本站一定已开放;可调用 ID、端点和价格请以模型广场为准。
文本、推理与代码
-
command-a-plus-05-2026稳定Cohere 当前旗舰 Command 型号,面向企业代理、工具和复杂推理。
语音与音频
-
cohere-transcribe-03-2026稳定Cohere 通用语音识别与转录型号。
-
cohere-transcribe-arabic-07-2026稳定面向阿拉伯语语音识别的专项转录型号。
向量、检索与重排
-
embed-v4.0稳定Cohere 最新多模态向量模型,适合文本与图像检索。
-
rerank-v4.0-pro稳定Cohere v4 高精度重排型号。
-
rerank-v4.0-fast稳定Cohere v4 低延迟重排型号。
适用场景
- 企业智能体与 RAG
- 嵌入和重排
- 多语言理解与生成
API 协议
/v1/chat/completions/v1/rerank
FAQ
Cohere 直连应该使用 /v2/chat 还是本站 /v1/chat/completions?
新直连项目使用 Cohere 原生 POST https://api.cohere.com/v2/chat、Cohere Bearer Key 和 V2 messages/响应结构。本站 /v1/chat/completions 是 OpenAI 兼容入口,由网关转换到已配置的 Cohere 渠道;它不是 Cohere 原生 URL,也不能直接照抄 V2 响应解析。
Cohere Embed 的 search_document 和 search_query 怎么选?
写入向量库的语料使用 search_document,用户检索词使用 search_query;分类和聚类分别使用对应的 classification、clustering。V3 及以上模型要求 input_type,文档端和查询端选错会让向量用途不匹配。
Cohere Embed 可以随时修改输出维度吗?
output_dimension 仅适用于 Embed v4 及更新模型,可选 256、512、1024 或 1536,默认 1536。向量库的旧向量与查询向量必须同模型、同维度和兼容归一化方式;修改后通常需要重建或并行迁移索引。
Cohere Rerank 应该放在 RAG 的哪一步?
先由关键词或向量检索召回较宽的候选集,再把 query 和 documents 交给 Rerank,按返回的 index 与 relevance_score 选取前几条。Cohere 原生路径是 /v2/rerank;本站已适配入口是 /v1/rerank,两者路径和响应契约不要混用。
Cohere Trial Key 和 Production Key 的限流有什么区别?
限流按模型和端点分别计算,不是统一倍数。当前官方表中,常见 Command Chat 为 Trial 20 次/分钟、Production 500 次/分钟;Rerank 为 10 与 1000 次/分钟;文本 Embed 两者都是每分钟 2000 个 inputs。最新模型可能要求联系销售,Trial 及部分新 Chat 还受月调用量限制,最终以官方实时表和账号为准。
Cohere 旧模型退役后只换一个别名就可以吗?
不一定。退役 ID 的请求会直接失败;例如 Embed v2.0 与部分 Aya 8B 型号已于 2026-04-04 退役。迁移要按 Deprecations 的替代型号重新验证请求字段、维度、索引、质量、成本和限流,不能只改字符串后直接上线。
关联指南
官方来源
- Cohere Chat API v2 Official
- Cohere Embed API v2 Official
- Cohere Rerank API v2 Official
- Cohere Rerank 模型说明 Official
- Cohere API Key 与限流 Official
- Cohere 模型与端点退役公告 Official
- Cohere API v1 迁移至 v2 Official
兔子API