局部参数归因是否能 inform 知识忘却?对语言模型中局部参数归因的严格检验
计算与语言
2026-02-12 v2
摘要
大型语言模型常常保留未被意图的内容,导致日益关注知识忘却的问题。最近的方法强调局部化忘却,将参数更新限制在特定区域以移除目标知识,同时保留与无关通用知识。然而,其有效性仍不明确 due to缺乏对忘却与保持无关知识之间权衡的稳健且彻底的评估。在本文中,我们首先重新审视现有的局部化忘却方法。随后进行受控实验,严格评估局部参数更新是否在因果上贡献于忘却。我们的发现表明,对于实现有效忘却而必须修改的参数集合并非严格确定,这挑战了局部化忘却的核心假设,即参数的局部性天然指示有效知识移除。
引用
@article{arxiv.2505.16252,
title = {Does Localization Inform Unlearning? A Rigorous Examination of Local Parameter Attribution for Knowledge Unlearning in Language Models},
author = {Hwiyeong Lee and Uiji Hwang and Hyelim Lim and Taeuk Kim},
journal= {arXiv preprint arXiv:2505.16252},
year = {2026}
}
备注
The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)