面向自动化事实核查:探索任务表述与LLM评估
计算与语言
2025-02-14 v1 人工智能
摘要
事实核查是解决误information信息不断增加的必要措施。传统事实核查依赖手动分析来验证主张,但速度慢且资源密集。本研究在多个标注方案(二分类、三分类、五分类)下,使用大型语言模型(LLM)进行自动化事实核查(AFC),建立基准对比。我们将传统主张验证扩展,融合分析、判决分类与解释,构建结构化方案,以提供针对真实主张的全面依据。我们在17,856个来自PolitiFact(2007-2024)的主张上,对Llama-3不同规模模型(3B、8B、70B)进行评估,依据通过受限网络搜索检索的证据进行评估。我们利用TIGERScore作为无参考评估指标,对依据进行评分。结果表明,较大的LLM在分类准确率和依据质量方面均无需微调即可持续优于较小的LLM。我们发现,较小的LLM在零样本场景下,与使用大上下文规模的经微调的小型语言模型(SLM)提供相当的任务性能,而较大的LLM则持续超越。证据整合在所有模型中均提升性能,较大的LLM受益最大。区分细粒度标签仍具有挑战性,强调需要进一步探索标注方案与证据间的对齐。我们的发现表明,检索增强的AFC与LLM具有潜力。
引用
@article{arxiv.2502.08909,
title = {Towards Automated Fact-Checking of Real-World Claims: Exploring Task Formulation and Assessment with LLMs},
author = {Premtim Sahitaj and Iffat Maab and Junichi Yamagishi and Jawan Kolanowski and Sebastian Möller and Vera Schmitt},
journal= {arXiv preprint arXiv:2502.08909},
year = {2025}
}