机制化不可知: 通过机制局部化实现稳健的知识不可知与编辑
机器学习
2024-12-06 v2 计算与语言
摘要
知识编辑和不可知的大语言模型方法旨在编辑或删除不令人满意的知识或功能,而不损害一般语言建模性能。本工作调查了如何通过机制可解释性——该方法部分旨在识别与特定可解释机制相关的模型组件(电路)以构成模型功能——来提高编辑和不可知的精确度和有效性。我们发现,基于不同方法局部化的组件进行不可知和编辑之间的存在显著差异。我们强调,基于主要保持输出的组件局部化方法与寻找具有可预测中间状态的高层机制方法之间的重要区别。特别是,将不可知/编辑局部化到与事实记忆查找表机制相关的组件会导致:1) 在不同输入/输出格式下实现更稳健的编辑/不可知,2) 抵抗重新学习所需信息的尝试,同时相对于基线方法还能减少意外副作用,这在运动事实数据集和 CounterFact 数据集上均通过多种模型得以验证。我们还发现,某些局部化的编辑会比其他任何基线方法都更显著地扰动模型中的潜在知识,从而使不可知对各种攻击更为稳健。
引用
@article{arxiv.2410.12949,
title = {Mechanistic Unlearning: Robust Knowledge Unlearning and Editing via Mechanistic Localization},
author = {Phillip Guo and Aaquib Syed and Abhay Sheshadri and Aidan Ewart and Gintare Karolina Dziugaite},
journal= {arXiv preprint arXiv:2410.12949},
year = {2024}
}
备注
31 pages, 45 figures, 7 tables