RAG评估算法
Ragas 和 TruLens
| 维度 | Ragas (Retrieval Augmented Generation Assessment) | TruLens |
|---|---|---|
| 主要定位 | 轻量级、专注于 RAG 指标的评估库 | 全链路的 LLM 观测(Observability)与调试框架 |
| 工作模式 | 离线批处理(Batch)。你需要先准备好一个包含“问题、检索上下文、回答”的数据集,丢给它跑出评分。 | 实时追踪(Tracing)。通过插桩(Instrumentation)接入你的代码,实时记录每一次运行并抓取链路数据。 |
| 可视化 | 无(通常在 Jupyter Notebook 或终端输出评分,或导出为 DataFrame)。 | 有强大的本地 UI Dashboard,可以单条记录、单步跟踪(Trace)排查报错原因。 |
| 核心卖点 | 指标极其丰富且细致(包括噪声敏感度、答案正确性等)。 | RAG 三元组(RAG Triad)、反馈函数(Feedback Functions)。 |
1. TruLens 的核心:RAG 三元组 (RAG Triad)
TruLens 把 RAG 系统的评估简化为了三个最核心的、形成闭环的维度:
上下文相关性 (Context Relevance):检索出来的文档片段,和用户的提问到底相关不相关?(测检索模块)
真实性/ groundedness:AI 生成的回答,是不是完全基于检索到的上下文?有没有凭空捏造(幻觉)?(测生成模块)
回答相关性 (Answer Relevance):AI 生成的回答,有没有真正解答用户最开始提的问题?(测最终体验)
2. Ragas 的指标:更全、更细
除了上述三个基础维度外,Ragas 提供了更垂直的细分指标:
Context Recall (上下文召回率):回答问题所需要的黄金信息,检索模块是不是全部捞出来了?
Context Precision (上下文精准度):捞出来的文档里,真正有用的信息是不是排在最前面?
Aspect Critique (多维度批判):甚至可以评估回答是否安全、是否有偏见、是否恶俗。