中文

并非错误,却是不实:LLM 在文档查询中的过度自信

计算与语言 2025-10-01 v1 人工智能

摘要

大型语言模型(LLM)日益被用于新闻工作流程,但其倾向于产生幻觉,构成了源头、归属和准确性等核心新闻实践的风险。我们对三个广泛使用的工具——ChatGPT、Gemini 和 NotebookLM——在以美国 TikTok 诉讼与政策为主题的 300 篇文档语料库为基础的报道式任务上进行评估。我们变更提示词的具体性和上下文大小,并使用一套分类法对句子级输出进行注释,以衡量幻觉类型和严重程度。我们所覆盖样本中,30% 的模型输出包含至少一个幻觉,其中 Gemini 和 ChatGPT(约 40%)的幻觉率显著高于 NotebookLM(13%)。从定性来看,大多数错误不涉及虚构实体或数字;相反,我们观察到的是解释性过度自信——模型添加了对来源不加支持的描述性表述,将归因意见转化为一般性陈述。这些模式揭示了根本性的认识论不匹配:尽管新闻学 requires 对每一项主张进行明确的来源归属,LLM 却会无论证据支持如何生成权威语气的文本。我们提出针对新闻工作室的 LLM 幻觉分类法扩展建议,主张有效的新闻工作室工具需要强制准确归因的体系结构,而非仅优化流畅度。

关键词

引用

@article{arxiv.2509.25498,
  title  = {Not Wrong, But Untrue: LLM Overconfidence in Document-Based Queries},
  author = {Nick Hagar and Wilma Agustianto and Nicholas Diakopoulos},
  journal= {arXiv preprint arXiv:2509.25498},
  year   = {2025}
}

备注

Accepted to Computation + Journalism Symposium 2025