Eval-Pair Matrix:面向接地RAG的LLM评判器的答案配对元评估
计算与语言
2026-07-12 v1
摘要
LLM作为评判器的评估被广泛用于检索增强生成(RAG),但将同一模型族同时用作生成器和评判器会使得自我宽容难以识别。我们引入了Eval-Pair Matrix,一种用于源接地RAG的受控元评估协议。从GaRAGe问题和接地段落出发,我们在每条记录中诱导一个隐藏的答案因果矛盾,使用GPT、Grok和Gemini模型从扰动段落生成答案,然后使用相同的模型作为盲评判器,根据原始段落评估每个答案。实验包含300条核心记录、897个带标签的生成器输出,以及在一个交叉的3x3矩阵中的2,683个评判器裁决;主要分析使用了275条完全验证的记录。我们没有比较不同答案的对角线和非对角线单元格,而是通过在完全相同的候选答案上配对评判器来估计同模型效应。这改变了解释:对角线和F1相似,配对的同模型召回效应接近于零(-0.5个百分点;95%聚类自助法置信区间[-2.7, +1.7])。唯一稳健的配对差距是,对于避免诱导主张的答案,匹配评判器的标记率较低(-4.3个百分点)。一项针对性的人工评估发现,被审查的明显假阳性是替代性源错误检测、关于诱导主张是否被采纳的标记错误,或不清楚的情况;没有一个被判定为真正的误报。教训是方法论上的:RAG评判器研究应报告完整矩阵、答案配对效应、行为分层和标签任务对齐。
关键词
引用
@article{arxiv.2607.10626,
title = {Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG},
author = {Sriram Selvam and Anneswa Ghosh},
journal= {arXiv preprint arXiv:2607.10626},
year = {2026}
}