中文

叠加中的知识:揭示大型语言模型终身知识编辑的失败根源

计算与语言 2025-02-27 v3

摘要

知识编辑旨在更新大型语言模型(LLMs)中过时或不正确的知识。然而,当前的知识编辑方法在终身编辑方面的可扩展性有限。本研究探讨了知识编辑在终身编辑中失败的根本原因。我们从线性联想记忆导出的闭式解开始,这是当前最先进知识编辑方法的基础。我们将该解从单次编辑扩展到终身编辑,并通过严格的数学推导,在最终解中识别出一个干扰项,表明编辑知识可能会影响不相关的知识。对干扰项的进一步分析揭示了其与知识表示之间叠加的密切关系。当语言模型中不存在知识叠加时,干扰项消失,从而实现无损知识编辑。跨众多语言模型的实验表明,知识叠加是普遍存在的,表现出高峰度、零均值和重尾分布,并具有清晰的缩放定律。最终,通过结合理论与实验,我们证明了知识叠加是终身编辑失败的根本原因。此外,这是首次从叠加的角度研究知识编辑,并提供了对众多真实世界语言模型中叠加现象的全面观察。代码可在 https://github.com/ChenhuiHu/knowledge_in_superposition 获取。

关键词

引用

@article{arxiv.2408.07413,
  title  = {Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models},
  author = {Chenhui Hu and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2408.07413},
  year   = {2025}
}

备注

To be published in AAAI 2025 (Oral)