模型同意了,但并未学习:诊断大语言模型中的表面合规性
计算与语言
2026-04-08 v1 人工智能
机器学习
摘要
大语言模型(LLM)将海量的世界知识内化为参数化记忆,但不可避免地继承了其源语料库的陈旧性和错误。因此,确保这些内部表示的可靠性和可塑性对于可信赖的现实世界部署至关重要。知识编辑提供了一种无需重新训练即可精确修改记忆的关键范式。然而,尽管最近的编辑者在标准基准上表现出高成功率,但当前依赖于在特定提示条件下评估输出的评估框架是否能够可靠地验证真正的记忆修改仍然值得怀疑。在这项工作中,我们引入了一个简单的诊断框架,该框架在更贴近现实应用环境的上下文学习(ICL)设置下对模型进行判别性自我评估,专门设计用于审视记忆修改引起的细微行为差异。这种探测揭示了一种普遍存在的表面合规性现象,即编辑者通过仅仅模仿目标输出而无需结构性覆盖内部信念即可获得高基准分数。此外,我们发现递归修改会累积表示残留,引发认知不稳定性并永久降低模型记忆状态的可逆性。这些见解强调了当前编辑范式的风险,并突出了稳健记忆修改在构建可信赖、长期可持续的LLM系统中的关键作用。代码可在https://github.com/XiaojieGu/SA-MCQ获取。
引用
@article{arxiv.2604.05995,
title = {The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models},
author = {Xiaojie Gu and Ziying Huang and Weicong Hong and Jian Xie and Renze Lou and Kai Zhang},
journal= {arXiv preprint arXiv:2604.05995},
year = {2026}
}
备注
ACL 2026 Findings