中文

智慧在于知其不言:通过注意力转移实现无幻觉的大语言模型遗忘

计算与语言 2026-04-20 v3

摘要

计算能力的提升以及AI辅助决策的必要性推动了大语言模型(LLM)的日益增长的应用。随之而来的问题是LLMs可能保留敏感数据,这促使对机器遗忘技术的日益增长的研究。然而,现有的遗忘方法面临一个关键困境:激进的遗忘会损害模型实用性,而保守的策略则可能保留实用性但风险幻觉响应。这显著限制了LLMs在知识密集型应用中的可靠性。为此,我们引入了一种新的注意力转移(Attention-Shifting,AS)框架,用于选择性遗忘。AS由两个设计目标驱动:(1)上下文保留抑制,通过削弱对事实相关token的注意力而不破坏LLMs的语言结构;(2)抗幻觉响应塑造,通过抑制针对遗忘内容查询的虚构完成。AS通过两种注意力水平的干预实现这些目标,这些干预是针对遗忘集合应用的重要性感知抑制,以减少对记忆知识的依赖,以及注意力引导的保留强化,以强化对保留数据集中语义关键token的注意力,以缓解意外的性能下降。这两个组件通过双损失目标联合优化,形成一种在表示叠加条件下软边界,将遗忘局部化并保持与无关知识的关系。实验结果表明,AS在保持性能方面优于现有方法,在ToFU基准上实现最高可达15%的准确率提升,在TDEC基准上提升10%,同时保持竞争的无幻觉遗忘效果。与现有方法相比,AS在遗忘效果、泛化和响应可靠性之间表现出更佳的平衡。

关键词

引用

@article{arxiv.2510.17210,
  title  = {Wisdom is Knowing What not to Say: Hallucination-Free LLMs Unlearning via Attention Shifting},
  author = {Chenchen Tan and Youyang Qu and Xinghao Li and Hui Zhang and Shujie Cui and Cunjian Chen and Longxiang Gao},
  journal= {arXiv preprint arXiv:2510.17210},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025