学习幻觉:记忆诱导的大语言模型自我知识人工膨胀
计算与语言
2025-12-23 v3
摘要
当人工智能将记忆误认为是智能时,就会创造出一种危险的推理幻觉。现有研究将记忆和大语言模型(LLM)的自我知识缺失视为独立的问题,未能认识到这种相互交织的关系如何降低了LLM回复的可信度。在本研究中,我们利用一种新框架,确定大语言模型是否真正从训练数据中学习推理模式,或仅仅记忆这些模式来假设自己在针对STEM领域问题(尤其是相似复杂度)的解题能力。我们的分析显示,在泛化方面存在一个值得注意的问题:当面对自验证且逻辑连贯的任务扰动时,大语言模型会从记忆已知的解决方案中获得信心,从而推断出更高的自我知识,从而在可行性评估上出现超过45%的不一致。这种效应在科学和医学领域最为显著,因为这些领域拥有最大比例的标准术语和问题,进一步确认了我们的方法。大语言模型自我知识中的显著波动也揭示了当前架构和训练模式的缺陷,凸显了确保模型对自身知识认知在可解释性和可信度方面具有平衡且一致态度的必要性。我们的代码和结果已公开发布于 https://github.com/Sahil-R-Kale/mirage_of_mastery
引用
@article{arxiv.2506.18998,
title = {Mirage of Mastery: Memorization Tricks LLMs into Artificially Inflated Self-Knowledge},
author = {Sahil Kale},
journal= {arXiv preprint arXiv:2506.18998},
year = {2025}
}
备注
12 pages, 9 figures