工程现场

RAG 系统不该只看回答:建立可诊断的离线评测

将 RAG 评测拆分为检索、生成和端到端体验三个层次,定位系统瓶颈。

RAGEvaluationLLMOps

RAG 系统不该只看回答:建立可诊断的离线评测

只让评审者给最终答案打分,无法知道问题出在切分、召回、重排还是生成。本篇把评测拆成可定位故障的三个层次。

检索层:证据有没有被找回来

针对带标准证据的查询,记录 Recall@K、MRR 和上下文覆盖率。没有候选证据时,模型很难凭生成环节补救。

生成层:模型有没有忠于上下文

观察答案正确性、引用完整性和幻觉率。生成正确但没有证据链的回答,在高风险场景依然不可用。

端到端层:用户任务有没有完成

记录任务完成率、响应延迟和人工纠错成本。它们决定系统是否真的能被持续使用。

← 返回工程现场专题地图