中文

重新思考定位-编辑模型编辑中的残差分布

计算与语言 2026-01-21 v3

摘要

模型编辑能够以最少的重新训练对大型语言模型(LLM)的知识进行定向更新。在现有方法中,定位-编辑方法构成了一个突出的范式:它们首先识别关键层,然后根据目标编辑计算最终关键层的残差,最后通过 残差分布\textbf{残差分布} 应用基于最小二乘的多层更新。尽管在经验上有效,我们发现了一种反直觉的失效模式:残差分布作为这些方法的核心机制,会引入权重偏移误差,从而破坏编辑精度。通过理论和实证分析,我们表明此类误差会随着分布距离、批量大小和编辑序列长度的增加而增大,最终导致不准确或次优的编辑。为了解决这个问题,我们提出了 B\textbf{B}oundary L\textbf{L}ayer U\textbf{U}pdatE (BLUE)\textbf{E (BLUE)} 策略来增强定位-编辑方法。在三个 LLM 和两个数据集上的顺序批量编辑实验表明,BLUE 不仅带来了平均 35.59% 的性能提升,显著推进了模型编辑的最新技术水平,而且还增强了对 LLM 通用能力的保持。我们的代码可在 https://github.com/xpq-tech/BLUE 获取。

关键词

引用

@article{arxiv.2502.03748,
  title  = {Rethinking Residual Distribution in Locate-then-Edit Model Editing},
  author = {Xiaopeng Li and Shanwen Wang and Shasha Li and Shezheng Song and Bin Ji and Jun Ma and Jie Yu},
  journal= {arXiv preprint arXiv:2502.03748},
  year   = {2026}
}

备注

NeurIPS 2025