基于智能体与检索模型探讨大语言模型事实核查在地理区域间的不平等性
计算与语言
2025-06-03 v2 人工智能
信息检索
摘要
事实核查是大语言模型 (LLM) 的一个可能有用的应用,旨在 combat 不断传播的虚假信息。然而,LLM 的性能在不同地理区域之间存在差异。本文评估了开放模型和私有模型在多样化地理区域和情景下的事实准确性。我们使用包含 600 条事实核查语句、均衡分布在六个全球地区的数据集,检验三种事实核查实验 setup:(1)仅提供语句本身;(2)利用基于 LLM 的智能体获取 Wikipedia 访问权限;(3)在检索增强生成 (RAG) 系统提供官方事实核查结果的理想情况下。我们的发现表明,无论是哪种情景和哪种 LLM,包括 GPT-4、Claude Sonnet 和 LLaMA 在内,来自全球北方的语句在准确性上显著优于来自全球南方的语句。此外,对于更真实的情况下的 Wikipedia 智能体系统,此差距进一步扩大,这表明过于笼统的知识库在解决地区特定细微差异方有限。这些结果凸显了改善 LLM 事实核查能力、特别是在地理上多样化的语境中,迫切需要更好的数据集平衡和稳健的检索策略。
关键词
引用
@article{arxiv.2503.22877,
title = {Understanding Inequality of LLM Fact-Checking over Geographic Regions with Agent and Retrieval models},
author = {Bruno Coelho and Shujaat Mirza and Yuyuan Cui and Christina Pöpper and Damon McCoy},
journal= {arXiv preprint arXiv:2503.22877},
year = {2025}
}