CrispEdit:面向可扩展非破坏性大语言模型编辑的低曲率投影
机器学习
2026-05-05 v2 人工智能
摘要
大语言模型(LLM)编辑中的核心挑战之一是能力保持:某些方法虽然成功改变了目标行为,却在编辑代理上悄然游戏,从而损坏通用能力,产生类似代理/奖励攻击的退化行为。我们提出了 CrispEdit,一种可扩展且原则化的二阶编辑算法,将能力保持作为显式约束来实现,从而统一并推广了几种现有编辑方法。CrispEdit 将编辑建模为约束优化问题,通过对编辑更新在能力损失景观的低曲率子空间进行投影来实现约束。CrispEdit 的核心在于通过 Bregman 发散来表达能力约束,其二次形式准确地得到高斯-牛顿 Hessian,即使基础模型未收敛到训练极限也是如此。我们利用 Kronecker 因子逼近曲率(K-FAC)以及一种新型矩阵无投影器,利用 Kronecker 结构避免构建巨大的投影矩阵,从而使二阶方法在 LLM 规模下高效运行。在标准模型编辑基准测试中,CrispEdit 在保持能力损坏低于 1% 的前提下实现了高编辑成功率,显著优于现有编辑方法。
引用
@article{arxiv.2602.15823,
title = {CrispEdit: Low-Curvature Projections for Scalable Non-Destructive LLM Editing},
author = {Zarif Ikram and Arad Firouzkouhi and Stephen Tu and Mahdi Soltanolkotabi and Paria Rashidinejad},
journal= {arXiv preprint arXiv:2602.15823},
year = {2026}
}
备注
ICML 2026