规模化真相:AI事实核查中的信心悖论
社会与信息网络
2025-09-11 v1 人工智能
计算与语言
计算机与社会
摘要
虚假信息的流行凸显了需要可扩展且可靠事实核查解决方案的需求。大型语言模型(LLM)在自动化事实验证方面潜力巨大,但其在全球语境中的有效性仍有疑问。我们系统评估了九个既定的LLM,涵盖开源/闭源、多个规模、多样化架构、基于推理等类别,测试了5000个先前由174个专业事实核查组织(覆盖47种语言)评估的声明。我们的 методlogy 测试了模型在训练截止日期之后提出的声明上的通用性,以及四种 prompting strategy,这些 strategy 镜像了市民和专业事实核查者的互动方式,总计超过24万人类标注作为 ground truth。我们的发现揭示了一种担忧的模式,类似于Dunning-Kruger效应:较小、可访问的模型显示出高置信度,尽管准确率较低;而较大的模型则表现出更高的准确率,但置信度较低。这一现象可能在信息验证中导致系统性偏见,因为资源受限的组织通常使用较小的模型。性能差距在非英语语言和来自全球南方的声明中最为显著,这威胁着扩大现有的信任信息不平等。这些结果为未来的研究建立了多语言基准,并为旨在确保可访问可靠AI辅助事实核查的政策提供了证据依据。
引用
@article{arxiv.2509.08803,
title = {Scaling Truth: The Confidence Paradox in AI Fact-Checking},
author = {Ihsan A. Qazi and Zohaib Khan and Abdullah Ghani and Agha A. Raza and Zafar A. Qazi and Wassay Sajjad and Ayesha Ali and Asher Javaid and Muhammad Abdullah Sohail and Abdul H. Azeemi},
journal= {arXiv preprint arXiv:2509.08803},
year = {2025}
}
备注
65 pages, 26 figures, 6 tables