在事实抽取与验证中针对含干扰实体的虚假声明的鲁棒信息检索
信息检索
2021-12-15 v1 机器学习
摘要
准确的证据检索对于自动化事实核查至关重要。以往很少研究关注真实与虚假声明之间的差异以及它们如何影响证据检索。本文表明,与真实声明相比,虚假声明更频繁地包含可能分散证据检索模型注意力的无关实体。基于 BERT 的检索模型在为虚假声明检索反驳证据时比为真实声明检索支持证据时犯更多错误。当用包含无关实体的对抗性虚假声明(合成生成)测试时,检索模型的召回率显著低于原始声明。这些结果表明,原始基于 BERT 的检索模型对虚假声明中的无关实体不鲁棒。通过用包含无关实体的合成虚假声明扩充训练数据,训练后的模型实现了更高的证据召回率,包括含无关实体的虚假声明的召回率。此外,使用单独的模型检索反驳和支持证据然后聚合它们也可以增加证据召回率,包括含无关实体的虚假声明的召回率。这些结果表明,我们可以通过数据扩充和模型集成来增加基于 BERT 的检索模型对含无关实体的虚假声明的鲁棒性。
引用
@article{arxiv.2112.07618,
title = {Robust Information Retrieval for False Claims with Distracting Entities In Fact Extraction and Verification},
author = {Mingwen Dong and Christos Christodoulopoulos and Sheng-Min Shih and Xiaofei Ma},
journal= {arXiv preprint arXiv:2112.07618},
year = {2021}
}