范数锚定使模型编辑持久化
机器学习
2026-05-07 v3 人工智能
摘要
顺序 Locate-and-Edit(L&E)模型编辑在进行多次编辑后会突然失败。我们识别并形式化了这种失败作为正向范数反馈环路,其特征是已解决的值向量和已编辑的 MLP 权重相互放大,从而恶化编辑质量并最终导致模型能力崩溃。我们的分析表明,这种反馈在标准 L&E 动力学下可产生约为指数级的范数增长,且无法被现有的 increment-level 正则化器或 update clamps 解决。我们提出了范数锚定缩放(Norm-Anchor Scaling,NAS),一种可插入的稳定器,通过将每个已解决的值向量缩放到原始模型参考范数来打破此循环。在多个 LLM backbone、数据集和 L&E 编辑器上,NAS 将可用的编辑时程延长超过 4 倍,并在平均情况下提高长期编辑性能72.2%,同时保持单次编辑的有效性,仅需一行代码且计算开销可忽略不计。
引用
@article{arxiv.2602.02543,
title = {Norm Anchors Make Model Edits Last},
author = {Mingda Liu and Zhenghan Zhu and Ze'an Miao and Katsuki Fujisawa},
journal= {arXiv preprint arXiv:2602.02543},
year = {2026}
}