从文章到前提:为事实核查证据构建PrimeFacts
计算与语言
2026-05-08 v1
摘要
事实核查文章编码了丰富的支持性证据和推理,但由于非结构化呈现,这些证据大多对自动化验证系统不可访问。我们介绍PrimeFacts,这是一种从完整事实核查文章中提取细粒度证据的方法和资源。我们编译了13,106篇PolitiFact文章,包含主张、裁决结果以及所有引用来源,我们识别出49,718篇文章内超链接作为自然锚点,以精确定位关键证据。我们的框架利用大型语言模型(LLM)将这些锚点句子改写为独立、无上下文的前提,并研究提取额外隐式证据的可能性。在针对跨文章证据检索和主张验证的评估中,提取的前景显著改善了性能。去上下文化的证据可提高可检索性,相对于逐字句子实现了最高30%的相对MRR提升,而且使用该证据进行裁决预测相对于基线提高了10-20分的Macro-F1。这些收益在不同的裁决粒度(2类 vs. 5类)和不同模型架构之间保持一致。定性分析表明,去上下文化的前提保持对原始来源的忠实性。我们的工作凸显了重复利用核查员证据用于自动化的潜力,并提供了一个来自真实世界核查的结构化证据大规模资源。
关键词
引用
@article{arxiv.2605.06006,
title = {From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence},
author = {Premtim Sahitaj and Jawan Kolanowski and Ariana Sahitaj and Veronika Solopova and Max Upravitelev and Daniel Röder and Iffat Maab and Junichi Yamagishi and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2605.06006},
year = {2026}
}
备注
Accepted at LREC 2026. To appear in the conference proceedings