RAG 系统不该只看回答:建立可诊断的离线评测
只让评审者给最终答案打分,无法知道问题出在切分、召回、重排还是生成。本篇把评测拆成可定位故障的三个层次。
检索层:证据有没有被找回来
针对带标准证据的查询,记录 Recall@K、MRR 和上下文覆盖率。没有候选证据时,模型很难凭生成环节补救。
生成层:模型有没有忠于上下文
观察答案正确性、引用完整性和幻觉率。生成正确但没有证据链的回答,在高风险场景依然不可用。
端到端层:用户任务有没有完成
记录任务完成率、响应延迟和人工纠错成本。它们决定系统是否真的能被持续使用。