中文

LLM 为什么难以支持事实核查

计算与语言 2025-09-29 v2 人工智能

摘要

虽然大语言模型 (LLM) 可放大线上虚假信息,但也显示出应对虚假信息的潜力。本文我们实证研究了三种 LLM(ChatGPT、Gemini 和 Claude)在反制政治虚假信息方面的能力。我们实现了一种两步骤、链步思考的提示方法,其中模型首先识别给定主张的可信来源,然后生成具有说服力的响应。我们的发现表明,模型在将响应锚定到真实新闻来源方面存在困难,倾向于引用左倾来源。我们还观察到不同模型在响应多样性方面存在程度差异。我们的发现凸显了仅通过提示工程使用 LLM 进行事实核查的担忧,强调需要更稳健的监控措施。我们的结果对研究人员和非技术用户都具有意义。

关键词

引用

@article{arxiv.2503.01902,
  title  = {How LLMs Fail to Support Fact-Checking},
  author = {Adiba Mahbub Proma and Neeley Pate and James Druckman and Gourab Ghoshal and Hangfeng He and Ehsan Hoque},
  journal= {arXiv preprint arXiv:2503.01902},
  year   = {2025}
}

备注

Adiba and Neeley contributed equally