中文

事实比观点更难——一项基于大语言模型的事实核查可靠性的多语言比较分析

计算机与社会 2025-10-22 v2 计算与语言

摘要

错误信息的泛滥需要可扩展的自动化事实核查解决方案。然而,当前的基准通常忽视了多语言和主题的多样性。本文引入了一个新颖的、动态可扩展的数据集,包含61,514条多语言和多主题的声明,扩展了现有数据集至2024年。通过对五种知名大语言模型(LLMs)的全面评估,包括GPT-4o、GPT-3.5 Turbo、LLaMA 3.1和Mixtral 8x7B,我们识别出不同语言和主题之间的显著性能差距。虽然总体上GPT-4o达到了最高的准确率,但它对43%的声明无法进行分类。在所有模型中,听起来像事实的声明比观点更容易被误分类,揭示了一个关键漏洞。这些发现强调了谨慎的必要性,并突显了在规模上部署基于LLM的事实核查系统所面临的挑战。

关键词

引用

@article{arxiv.2506.03655,
  title  = {Facts are Harder Than Opinions -- A Multilingual, Comparative Analysis of LLM-Based Fact-Checking Reliability},
  author = {Lorraine Saju and Arnim Bleier and Jana Lasser and Claudia Wagner},
  journal= {arXiv preprint arXiv:2506.03655},
  year   = {2025}
}