RAG 检索评估
版本说明
本文档基于 Obsidian v1.13(稳定版)整理,功能可能随版本更新,建议结合官方说明实践。
为什么评估
本地知识库问答常出现「答非所问」「编造」。评估能定位是检索还是生成的问题。
核心指标
| 指标 | 含义 | 目标 |
|---|---|---|
| 召回率 | 相关块被检索到的比例 | >0.8 |
| 上下文相关 | 检索块与问题相关度 | >0.9 |
| 忠实度 | 答案是否基于上下文 | >0.95 |
| 答案相关 | 答案解决问题 | >0.9 |
实测方法
- 准备 20 道「问题-标准答案」对。
- 记录每次检索到的块与最终答案。
- 用 LLM-as-judge 打分,人工抽检 30%。
优化清单
- 块切分:按标题/段落,避免截断语义
- 嵌入模型:中文用 bge-m3 / bge-large
- 混合检索:向量 + 关键词(BM25)