中文

面向语言模型的上下文鲁棒知识编辑

计算与语言 2025-06-03 v2 人工智能

摘要

知识编辑(KE)方法为修改大语言模型中的知识提供了一种高效途径。当前的 KE 评估通常仅考虑被编辑的知识而没有任何前文上下文来评估编辑成功率。然而,在实际应用中,前文上下文往往会触发对原始知识的检索,从而破坏预期的编辑效果。为了解决这一问题,我们开发了 CHED——一个旨在评估 KE 方法上下文鲁棒性的基准。在 CHED 上的评估表明,当前文上下文存在时,这些方法经常会失败。为了缓解这一缺陷,我们引入了 CoRE,这是一种 KE 方法,旨在通过最小化模型对被编辑知识隐藏状态中上下文敏感的方差来增强上下文鲁棒性。该方法不仅提高了存在前文上下文情况下的编辑成功率,而且保留了模型的整体能力。我们深入分析了前文上下文作为用户话语与助手回复时产生的不同影响,并剖析了注意力分数模式,以评估特定 token 如何影响编辑成功率。

关键词

引用

@article{arxiv.2505.23026,
  title  = {Context-Robust Knowledge Editing for Language Models},
  author = {Haewon Park and Gyubin Choi and Minjun Kim and Yohan Jo},
  journal= {arXiv preprint arXiv:2505.23026},
  year   = {2025}
}

备注

ACL 2025 Findings. Our code and datasets are available at https://github.com/holi-lab/CoRE