AI 生成新闻报道事实核查:大型语言模型能否捕捉自身的谎言?
计算与语言
2025-03-25 v1
摘要
本文评估了大型语言模型(LLM) assessing 自身或其他 LLM 生成的“新闻报道”中声明可信度的能力。我们的目标是确定 LLM 是否能够像用于验证人类所作声明的方法一样有效地进行事实核查。我们的发现表明,LLM 在评估国际或国际新闻故事中的声明方面比在地方新闻故事中更有效,更擅长评估静态信息而非动态信息,更擅长验证真实声明而非虚假声明。我们假设,这种差异是由于前者类型声明在训练数据中得到更好表示所致。此外,我们发现,在检索增强生成(RAG)setting 中 incorporating 检索到的搜索结果显著减少了 LLM 无法评估的声明数量。然而,这种方法也会增加错误评估的发生,部分原因是检索结果不相关或质量较低。该诊断性研究突显了未来研究在事实核查机器生成报告方面的需求,强调需要优先改进检索信息的精度和相关性,以更好地支持事实核查工作。此外,针对动态事件和地方新闻,可能需要人类在环事实核查系统来确保准确性和可靠性。
引用
@article{arxiv.2503.18293,
title = {Fact-checking AI-generated news reports: Can LLMs catch their own lies?},
author = {Jiayi Yao and Haibo Sun and Nianwen Xue},
journal= {arXiv preprint arXiv:2503.18293},
year = {2025}
}