use-case
RAG、Embedding 与重排模型指南
直接答案RAG 是切分、Embedding、召回、重排、证据生成和评测组成的系统;完整性来自可引用证据和无答案处理,不来自更大的模型目录。
更新 · 审核信息
RAG 不是单个模型
可靠 RAG 包括数据清洗与权限、切分、Embedding、向量/关键词召回、Rerank、上下文组装、基于证据生成和引用。跳过任何一层都可能把“模型回答流畅”误当作检索正确。
建立索引
为文档和查询使用官方指定的 input type,记录 Embedding 型号、维度、归一化和切分版本。更换型号或维度时建立新索引并灰度迁移,不能在同一向量空间混用。
查询流程
先做权限过滤,再混合召回足够候选,使用 Rerank 缩小集合,并把文档 ID、标题和位置连同正文交给生成模型。明确要求仅依据证据回答,无证据时返回不知道。
如何评测
分别测 Recall@K、MRR/NDCG、重排质量、答案正确率、引用覆盖、引用一致性、无答案准确率和延迟。数据集必须包含过期、冲突、权限不足与检索不到的案例。
安全与运维
防止文档中的提示注入获得工具权限;引用内容与系统指令隔离。监控索引新鲜度、空召回、越权、模型升级和成本,并支持删除请求同步到所有索引。
适用场景
- 企业知识问答
- 语义搜索
- 检索重排
API 协议
/v1/embeddings/v1/rerank/v1/chat/completions
FAQ
更换 Embedding 模型后可以继续使用原来的向量索引吗?
通常不可以。模型、维度、归一化或 input type 改变都可能使向量空间不兼容;应建立新索引、记录版本并灰度迁移,不能把新旧向量混在同一索引中。
上下文窗口足够大后,还需要 RAG 和 Rerank 吗?
仍可能需要。直接塞入大量文档会增加费用和延迟,并不能保证关键证据被关注;检索与重排能先做权限过滤、缩小证据集合,并为回答提供可追溯引用。
怎样评测 RAG,能只看最终回答是否流畅吗?
不能。应分别测 Recall@K、MRR/NDCG、重排质量、答案正确率、引用覆盖与一致性、无答案准确率和延迟,并加入过期、冲突、无权限及无证据案例。
如何防止 RAG 泄露越权文档或执行文档里的提示注入?
检索前执行服务端权限过滤,把文档内容与系统指令隔离,并禁止检索文本直接获得工具权限。日志和索引要支持脱敏、租户隔离与删除同步,回答还应保留文档 ID 和位置以便审计。
关联指南
官方来源
- Jina Models Official
- Cohere Models Official
兔子API