Ev2R:自动事实核查中的证据检索评估
计算与语言
2025-07-22 v2 人工智能
信息检索
机器学习
摘要
当前的自动事实核查(AFC)方法通常通过预测的判定结果隐式地评估证据,或通过与预定义的封闭知识源(如维基百科)的精确匹配来评估证据。然而,这些方法受限于其依赖最初为其他目的设计的评估指标以及封闭知识源的限制。在本工作中,我们提出了\textbf{\textcolor{skyblue}{Ev}\textsuperscript{2}\textcolor{orangebrown}{R}},它结合了基于参考的评估和判定层级代理评分的优势。Ev\textsuperscript{2}R联合评估证据与金标准参考的对齐程度以及证据对判定结果的支撑可靠性,从而弥补了先前方法的不足。我们将Ev\textsuperscript{2}R与三种证据评估方法进行了对比:基于参考的、代理参考的和无参考的基线方法。针对人工评分和对抗性测试的评估表明,Ev\textsuperscript{2}R在准确性和鲁棒性方面持续优于现有的评分方法。它与人工判断具有更强的相关性,并对对抗性扰动表现出更大的鲁棒性,从而确立了其作为AFC中证据评估的可靠指标的地位。\footnote{代码可在\href{https://github.com/mubasharaak/fc-evidence-evaluation}{https://github.com/mubasharaak/fc-evidence-evaluation}获取。}
引用
@article{arxiv.2411.05375,
title = {Ev2R: Evaluating Evidence Retrieval in Automated Fact-Checking},
author = {Mubashara Akhtar and Michael Schlichtkrull and Andreas Vlachos},
journal= {arXiv preprint arXiv:2411.05375},
year = {2025}
}
备注
Accepted at TACL