超越协方差陷阱:大语言模型同一主体知识编辑中的泛化能力提升
计算与语言
2026-03-17 v1
摘要
虽然定位-编辑知识编辑高效地更新嵌入于大语言模型(LLM)中的知识,但在实际的同一主体知识编辑场景中,仍会出现一个关键的泛化失败模式:模型在遵循用户指令时未能召回更新后的知识,尽管在原始编辑形式下成功召回。本文识别了这种泛化崩溃的几何根源,作为一种在编辑后模型几何容忍度之内出现的几何冲突:即内激活随提示变化而产生的漂移超过模型的几何容忍度。我们将这种不稳定性归因于双重病理:(1)联合优化伴随正交梯度会将解压缩到锋利的最小值中,稳定性较窄;(2)标准协方差约束反之成为协方差陷阱,放大输入扰动。为解决此问题,我们引入RoSE(Robust Same-subject Editing),采用各向同性几何对齐来最小化表征偏差,并采用层次知识集成来平滑优化景观。大量实验表明,RoSE显著提升了指令跟随能力,为可靠的交互式参数记忆 LLM 智能体奠定了基础。
引用
@article{arxiv.2603.15518,
title = {Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models},
author = {Xiyu Liu and Qingyi Si and Zhengxiao Liu and Chenxu Yang and Naibin Gu and Zheng Lin},
journal= {arXiv preprint arXiv:2603.15518},
year = {2026}
}
备注
23 pages, 20 figures