利用内部信号评估未标注数据中可核查声明识别的有效性以用于自动事实核查
计算与语言
2021-11-03 v1 人工智能
信息检索
摘要
尽管近期关于自动事实核查的工作主要集中于验证和解释声明(其声明列表易于获取),但从文本中识别可核查的声明句子仍具挑战性。当前的声明识别模型依赖于对文本中每个句子的人工标注,这是一项成本高昂的任务,且难以在多个领域频繁进行。本文探索了一种方法,无需明确的句子级标注,即可从虚假新闻文章中识别可核查的声明句子,且不受领域限制。我们利用两种内部监督信号——标题和抽象式摘要——基于语义相似度对句子进行排序。我们假设这种排序与句子的可核查性直接相关。为评估该假设的有效性,我们构建了基于标题或抽象式摘要的句子排序流程。排序靠前的句子被用于下游的事实核查任务,即证据检索和流程对文章真实性的预测。我们的发现表明,排名前三的句子包含足够的信息,可用于对虚假新闻文章进行基于证据的事实核查。我们还表明,虽然标题与事实核查网站撰写声明的方式在要点相似度上更高,但基于摘要的流程对于端到端事实核查系统最具前景。
引用
@article{arxiv.2111.01706,
title = {Assessing Effectiveness of Using Internal Signals for Check-Worthy Claim Identification in Unlabeled Data for Automated Fact-Checking},
author = {Archita Pathak and Rohini K. Srihari},
journal= {arXiv preprint arXiv:2111.01706},
year = {2021}
}
备注
7 pages, 2 figures