中文

忘记即遗忘:注意力汇作为作弊性无监督 LLM 之门

机器学习 2025-10-21 v1 计算与语言

摘要

大语言模型(LLM)无监督已成为从预训练模型中移除不希望的数据、知识或行为,同时保持其一般实用性的关键机制。然而,随着开源 LLM 的兴起,我们提出:无监督过程本身是否可能被作弊化,当正常条件下表现为成功,但在隐藏触发器激活时,恢复到事前无监督的行为。drawing inspiration from classical backdoor attacks that embed triggers into training data to enforce specific behaviors, 我们研究作弊性无监督,即模型在干净设置下按预期忘记,但在触发器出现时恢复被忘记的知识。我们表明,设计此类攻击具有独特挑战,取决于触发器放置位置以及如何加强作弊训练。我们发现,作弊效果与注意力汇现象之间存在强烈关联,即浅层输入标记在 LLM 中持续吸引不成比例的注意力。我们的分析表明,这些注意力汇作为作弊性无监督的入口:将触发器置于汇位置并对其注意力值进行对齐,可显著增强作弊持久性。广泛实验验证了这些发现,表明注意力汇引导的作弊性无监督在作弊触发器存在时可靠地恢复被忘记的知识,而在触发器不存在时,行为与正常无监督的模型无异。代码地址:https://github.com/OPTML-Group/Unlearn-Backdoor。

关键词

引用

@article{arxiv.2510.17021,
  title  = {Forgetting to Forget: Attention Sink as A Gateway for Backdooring LLM Unlearning},
  author = {Bingqi Shang and Yiwei Chen and Yihua Zhang and Bingquan Shen and Sijia Liu},
  journal= {arXiv preprint arXiv:2510.17021},
  year   = {2025}
}