Skip to content

RAG 检索评估

版本说明

本文档基于 Obsidian v1.13(稳定版)整理,功能可能随版本更新,建议结合官方说明实践。

为什么评估

本地知识库问答常出现「答非所问」「编造」。评估能定位是检索还是生成的问题。

核心指标

指标含义目标
召回率相关块被检索到的比例>0.8
上下文相关检索块与问题相关度>0.9
忠实度答案是否基于上下文>0.95
答案相关答案解决问题>0.9

实测方法

  1. 准备 20 道「问题-标准答案」对。
  2. 记录每次检索到的块与最终答案。
  3. 用 LLM-as-judge 打分,人工抽检 30%。

优化清单

  • 块切分:按标题/段落,避免截断语义
  • 嵌入模型:中文用 bge-m3 / bge-large
  • 混合检索:向量 + 关键词(BM25)