中文

我们在评估 LLM 模型编辑的编辑局部性时,是否正在进行得当?

人工智能 2026-01-27 v1

摘要

模型编辑最近作为一种高效更新大语言模型(LLM)知识的流行方法,引发广泛关注。知识更新的核心需求是,在实现编辑效果(即成功注入目标知识)与特定性(即也称为编辑局部性,保持现有非目标知识)之间取得平衡。然而,我们发现现有的特定性评估协议对此目的不充分。我们系统性地阐述了其面临的三个根本性问题。除了概念性问题之外,我们进一步通过实证研究表明,现有的特定性指标与特定性正则化强度之间关联性较弱。我们还发现,当前的指标缺乏足够的灵敏度,导致它们无效地区分不同方法的特定性性能。最后,我们提出了一种建设性的评估方案。该方案消除了开放式 LLM 与确定性答案假设之间的冲突,避免查询独立的流畅性偏差,并允许在接近连续空间内平滑调整评估严格程度。在各种 LLMs、数据集和编辑方法的实验中表明,基于我们提出方案得出的指标对特定性正则化强度的变化更灵敏,并与之呈现强相关,从而更好地区分不同方法的知识保留能力。

关键词

引用

@article{arxiv.2601.17343,
  title  = {Are We Evaluating the Edit Locality of LLM Model Editing Properly?},
  author = {Wei Liu and Haomei Xu and Hongkai Liu and Zhiying Deng and Ruixuan Li and Heng Huang and Yee Whye Teh and Wee Sun Lee},
  journal= {arXiv preprint arXiv:2601.17343},
  year   = {2026}
}