中文

隐藏状态到底藏了什么?测试大语言模型事实编码能力的极限

计算与语言 2025-06-02 v3 人工智能

摘要

事实性幻觉是大语言模型(LLM)面临的主要挑战之一。它们通过生成不准确或虚构内容来破坏可靠性和用户信任。最近的研究表明,在生成虚假陈述时,大语言模型的内部状态会编码关于真实性的信息。然而,这些研究常常依赖缺乏真实感的人工合成数据集,这限制了对模型自身生成文本事实准确性的评估。本文通过调查真实性编码能力,挑战了前期研究的结论,同时构建了更真实且具挑战性的数据集。具体而言,我们在引入以下两方面:(1)从表格数据中抽样生成合理的真假事实句子的方法,(2)从问答数据集生成真实、依赖于大语言模型的真假数据集的程序。我们的分析表明,尽管来自前期研究的发现在部分得到验证,但对大语言模型生成数据集的泛化仍然具有挑战性。这一研究为未来研究大语言模型的事实性提供了基础,并为更有效的评估提供了实用指南。

关键词

引用

@article{arxiv.2505.16520,
  title  = {Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMs},
  author = {Giovanni Servedio and Alessandro De Bellis and Dario Di Palma and Vito Walter Anelli and Tommaso Di Noia},
  journal= {arXiv preprint arXiv:2505.16520},
  year   = {2025}
}