大型语言模型在可靠政治事实核查中需要精心挑选的上下文 —— 即使拥有推理与网络搜索能力
计算与语言
2025-11-25 v1 计算机与社会
信息检索
摘要
大型语言模型(LLMs)曾引发对自动化端到端事实核查的期望,但 prior 研究报告了混合结果。随着主流聊天机器人日益集成推理能力和网络搜索工具——以及数百万用户已依赖它们进行核查——亟需进行严格评估。我们对 15 个来自 OpenAI、Google、Meta 和 DeepSeek 的最新 LLMs 在超过 6000 条被 PolitiFact 核查的声明上进行评估,将标准模型与推理和网络搜索变体进行比较。标准模型表现不佳,推理带来的益处微乎其微,网络搜索仅提供适度提升,尽管事实核查在网上是可获取的。相比之下,使用 PolitiFact 摘要构建的精选 RAG 系统在所有模型变体上平均将宏观 F1 分数提高了 233%。这些发现表明,为模型提供精心挑选的高质量上下文是自动化事实核查的有前景的路径。
引用
@article{arxiv.2511.18749,
title = {Large Language Models Require Curated Context for Reliable Political Fact-Checking -- Even with Reasoning and Web Search},
author = {Matthew R. DeVerna and Kai-Cheng Yang and Harry Yaojun Yan and Filippo Menczer},
journal= {arXiv preprint arXiv:2511.18749},
year = {2025}
}