中文

SAKE:用于知识编辑的引导激活

人工智能 2025-07-30 v2 计算与语言 机器学习

摘要

随着大语言模型被证明会记忆真实世界的事实,更新这些知识以受控且高效的方式的需求日益增长。知识编辑(KE)方法旨在更新预训练模型中的特定事实,但已被证明存在若干局限,包括其对上下文鲁棒性不足以及对与该事实相关的逻辑推断的泛化能力不足。为克服这些问题,我们提出SAKE(Steering Activations for Knowledge Editing),一种引导激活方法,将待编辑的事实建模为分布而非单个提示。基于最优传输(Optimal Transport),SAKE在整个与事实相关的分布(包括同义句和逻辑推断)上改变LLM行为。多个数值实验表明,该方法的有效性:SAKE能够比其现有方法更稳健地进行编辑。

关键词

引用

@article{arxiv.2503.01751,
  title  = {SAKE: Steering Activations for Knowledge Editing},
  author = {Marco Scialanga and Thibault Laugel and Vincent Grari and Marcin Detyniecki},
  journal= {arXiv preprint arXiv:2503.01751},
  year   = {2025}
}