use-case
通用文本、对话与推理模型指南
直接答案通用文本模型覆盖问答、写作、抽取和分析,推理模型更适合多步问题;生产选型应以真实任务正确率、延迟、成本和可控性共同判断。
更新 · 审核信息
先区分任务深度
摘要、改写、分类和简单问答通常更看重速度、价格与稳定格式;数学、规划、复杂分析和多约束决策更依赖推理能力。不要让所有流量默认进入最昂贵的型号,应按任务难度路由并保留降级方案。
关键选型维度
先用真实输入比较正确率、指令遵循、结构化输出成功率、上下文长度、首 token 延迟和总成本。需要联网、文件或业务系统时,还要验证工具调用、权限边界和失败恢复;模型知识不能代替实时数据源。
最小调用方式
本站使用 Bearer 令牌。模型名称必须来自模型广场,客户端应设置超时并区分鉴权、限流、上下文超限和上游错误。
curl "$BASE_URL/v1/chat/completions" \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"MODEL_NAME","messages":[{"role":"user","content":"请分析这个问题"}]}'
如何验证质量
从真实业务中抽取固定样本,分别记录事实正确率、格式通过率、人工修改量、拒答质量、延迟和费用。对开放问答使用可追溯来源或人工评分,对结构化任务使用确定性校验,不以模型自评作为结论。
常见限制
上下文窗口不等于有效记忆,长输入会增加延迟并可能稀释关键信息。温度、推理强度、JSON Schema、工具和缓存字段并非所有模型都支持;上线前应对目标型号和实际渠道做字段级契约测试。
适用场景
- 知识问答与内容生成
- 复杂分析与多步推理
- 结构化抽取与分类
API 协议
/v1/responses/v1/chat/completions/v1/messages
FAQ
Responses、Chat Completions 和 Messages 应该选哪个协议?
先看目标模型和渠道实际支持的端点。已有 messages/choices 客户端可继续用 Chat,新工作流可评估 Responses,Claude 原生结构通常使用 Messages;三者的工具、流式事件和响应字段不同,不能只改 URL。
推理模型一定比普通文本模型好吗?
不一定。多步数学、代码和复杂约束更可能受益于推理,摘要、分类和简单抽取通常更看重低延迟与稳定格式。推理会增加等待时间和输出 token,应按任务难度路由并设置预算。
如何比较两个文本模型,能只看公开榜单吗?
不能。用真实业务样本同时记录事实正确率、格式通过率、人工修改量、拒答质量、首 token/总延迟和实际费用;结构化任务用程序校验,开放问答用来源或人工量表。
上下文窗口很大就等于模型会可靠记住全部内容吗?
不等于。长输入会增加费用和延迟,也可能稀释关键信息。只发送完成任务所需内容,敏感数据先脱敏并核对服务的数据保留条款;重要事实仍需检索、引用或确定性验证。
关联指南
官方来源
- OpenAI Models Official
- Claude Models Official
- Gemini Models Official
兔子API