可信、不可靠或泄露?面向增强自动化事实核查的证据验证
计算与语言
2024-05-01 v1 计算机与社会
信息检索
社会与信息网络
摘要
自动化事实核查(Automated fact-checking, AFC)正因研究人员致力于帮助事实核查者对抗网络上日益扩散的虚假信息而受到日益关注。虽然许多现有的AFC方法会整合网络上的外部信息以帮助检验论点的真实性,但往往忽视了验证所收集“证据”来源和质量的重要性。一个被忽视的挑战在于依赖于“泄露证据”——即直接从事实核查网站收集的信息并用于训练AFC系统,导致早期虚假信息检测处于不切实际的环境下。类似地,可靠来源的信息可能削弱事实核查系统的效果。为应对这些挑战,我们提出了一套全面的证据验证与过滤方法。我们创建了“可信、不可靠或被核查”(CREDIBLE, Unreliable or Leaked, 简称CREDULE)数据集,包含91,632篇文章,分类为可信、不可靠和被核查(泄露)。此外,我们引入了证据验证网络(EVidence VERification Network, EVVER-Net),在CREDULE数据集上训练,用于检测短文本和长文本中的泄露和不可靠证据。EVVER-Net可用于过滤从网络上收集的证据,从而增强端到端AFC系统的鲁棒性。我们实验多种语言模型,表明EVVER-Net在利用域可信度分数以及短文本或长文本时,分别可达到最高91.5%和94.4%的准确率。最后,我们评估了包括LIAR-PLUS、MOCHEG、FACTIFY、NewsCLIPpings+和VERITE在内的众多常用事实核查数据集中的证据,其中一些数据集显示出令人关注的泄露和不可靠证据比例。
引用
@article{arxiv.2404.18971,
title = {Credible, Unreliable or Leaked?: Evidence Verification for Enhanced Automated Fact-checking},
author = {Zacharias Chrysidis and Stefanos-Iordanis Papadopoulos and Symeon Papadopoulos and Panagiotis C. Petrantonakis},
journal= {arXiv preprint arXiv:2404.18971},
year = {2024}
}