叠加中的知识:揭示大型语言模型终身知识编辑的失败根源
计算与语言
2025-02-27 v3
摘要
知识编辑旨在更新大型语言模型(LLMs)中过时或不正确的知识。然而,当前的知识编辑方法在终身编辑方面的可扩展性有限。本研究探讨了知识编辑在终身编辑中失败的根本原因。我们从线性联想记忆导出的闭式解开始,这是当前最先进知识编辑方法的基础。我们将该解从单次编辑扩展到终身编辑,并通过严格的数学推导,在最终解中识别出一个干扰项,表明编辑知识可能会影响不相关的知识。对干扰项的进一步分析揭示了其与知识表示之间叠加的密切关系。当语言模型中不存在知识叠加时,干扰项消失,从而实现无损知识编辑。跨众多语言模型的实验表明,知识叠加是普遍存在的,表现出高峰度、零均值和重尾分布,并具有清晰的缩放定律。最终,通过结合理论与实验,我们证明了知识叠加是终身编辑失败的根本原因。此外,这是首次从叠加的角度研究知识编辑,并提供了对众多真实世界语言模型中叠加现象的全面观察。代码可在 https://github.com/ChenhuiHu/knowledge_in_superposition 获取。
引用
@article{arxiv.2408.07413,
title = {Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models},
author = {Chenhui Hu and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2408.07413},
year = {2025}
}
备注
To be published in AAAI 2025 (Oral)