LLM 为什么难以支持事实核查
计算与语言
2025-09-29 v2 人工智能
摘要
虽然大语言模型 (LLM) 可放大线上虚假信息,但也显示出应对虚假信息的潜力。本文我们实证研究了三种 LLM(ChatGPT、Gemini 和 Claude)在反制政治虚假信息方面的能力。我们实现了一种两步骤、链步思考的提示方法,其中模型首先识别给定主张的可信来源,然后生成具有说服力的响应。我们的发现表明,模型在将响应锚定到真实新闻来源方面存在困难,倾向于引用左倾来源。我们还观察到不同模型在响应多样性方面存在程度差异。我们的发现凸显了仅通过提示工程使用 LLM 进行事实核查的担忧,强调需要更稳健的监控措施。我们的结果对研究人员和非技术用户都具有意义。
引用
@article{arxiv.2503.01902,
title = {How LLMs Fail to Support Fact-Checking},
author = {Adiba Mahbub Proma and Neeley Pate and James Druckman and Gourab Ghoshal and Hangfeng He and Ehsan Hoque},
journal= {arXiv preprint arXiv:2503.01902},
year = {2025}
}
备注
Adiba and Neeley contributed equally