中文

基于门控激活重定向的推理时机器忘卸

机器学习 2026-05-19 v2

摘要

大型语言模型记忆了大量训练数据,引发了关于隐私、版权侵权和安全的关注。机器忘卸旨在移除特定忘卸集的影响,同时保持模型性能,理想情况下接近无忘卸集重新训练的模型。现有方法通过梯度方法更新模型参数来实现这一目标,但这些更新计算昂贵、导致不可逆的权重变更,并且在模型量化部署时性能下降。最近一种改进方法是通过激活工程,在推理时改变激活来引导模型行为。尽管规避了权重编辑,但朴素的激活引导引入了自己的失败模式,因为单个全局引导向量对每个输入都施加相同的干预,导致模型行为的意外变化。我们引入推理时机器忘卸通过门控激活重定向(GUARD-IT),这是一种无需训练和梯度的方法,通过推理时的输入依赖激活引导来实现忘卸。所得干预以残差流中的范数保持旋转方式应用,保持模型权重不变。对 TOFU 和 MUSE 上的实验表明,GUARD-IT 在三个模型规模上与 12 个梯度基线方法相匹配或超越,同时是唯一在所有设置下同时保持实用性、抑制记忆、避免灾难性崩溃的方法。GUARD-IT 进一步支持无需再训练的持续忘卸,并且在量化情境下仍然有效,而参数编辑方法在此情境下会降级。

关键词

引用

@article{arxiv.2605.12765,
  title  = {Inference-Time Machine Unlearning via Gated Activation Redirection},
  author = {Vinícius Conte Turani and Otávio Parraga and João Vitor Boer Abitante and Kristen K. Arguello and Joana Pasquali and Ramiro N. Barros and Flavio du Pin Calmon and Christian Mattjie and Rodrigo C. Barros and Lucas S. Kupssinskü},
  journal= {arXiv preprint arXiv:2605.12765},
  year   = {2026}
}