use-case

通用文本、对话与推理模型指南

直接答案通用文本模型覆盖问答、写作、抽取和分析,推理模型更适合多步问题;生产选型应以真实任务正确率、延迟、成本和可控性共同判断。

更新 · 审核信息

先区分任务深度

摘要、改写、分类和简单问答通常更看重速度、价格与稳定格式;数学、规划、复杂分析和多约束决策更依赖推理能力。不要让所有流量默认进入最昂贵的型号,应按任务难度路由并保留降级方案。

关键选型维度

先用真实输入比较正确率、指令遵循、结构化输出成功率、上下文长度、首 token 延迟和总成本。需要联网、文件或业务系统时,还要验证工具调用、权限边界和失败恢复;模型知识不能代替实时数据源。

最小调用方式

本站使用 Bearer 令牌。模型名称必须来自模型广场,客户端应设置超时并区分鉴权、限流、上下文超限和上游错误。

curl "$BASE_URL/v1/chat/completions" \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"MODEL_NAME","messages":[{"role":"user","content":"请分析这个问题"}]}'

如何验证质量

从真实业务中抽取固定样本,分别记录事实正确率、格式通过率、人工修改量、拒答质量、延迟和费用。对开放问答使用可追溯来源或人工评分,对结构化任务使用确定性校验,不以模型自评作为结论。

常见限制

上下文窗口不等于有效记忆,长输入会增加延迟并可能稀释关键信息。温度、推理强度、JSON Schema、工具和缓存字段并非所有模型都支持;上线前应对目标型号和实际渠道做字段级契约测试。

适用场景

  • 知识问答与内容生成
  • 复杂分析与多步推理
  • 结构化抽取与分类

API 协议

  • /v1/responses
  • /v1/chat/completions
  • /v1/messages

FAQ

Responses、Chat Completions 和 Messages 应该选哪个协议?

先看目标模型和渠道实际支持的端点。已有 messages/choices 客户端可继续用 Chat,新工作流可评估 Responses,Claude 原生结构通常使用 Messages;三者的工具、流式事件和响应字段不同,不能只改 URL。

推理模型一定比普通文本模型好吗?

不一定。多步数学、代码和复杂约束更可能受益于推理,摘要、分类和简单抽取通常更看重低延迟与稳定格式。推理会增加等待时间和输出 token,应按任务难度路由并设置预算。

如何比较两个文本模型,能只看公开榜单吗?

不能。用真实业务样本同时记录事实正确率、格式通过率、人工修改量、拒答质量、首 token/总延迟和实际费用;结构化任务用程序校验,开放问答用来源或人工量表。

上下文窗口很大就等于模型会可靠记住全部内容吗?

不等于。长输入会增加费用和延迟,也可能稀释关键信息。只发送完成任务所需内容,敏感数据先脱敏并核对服务的数据保留条款;重要事实仍需检索、引用或确定性验证。

官方来源

  1. OpenAI Models Official
  2. Claude Models Official
  3. Gemini Models Official