中文

ALTER:基于Token熵的非对称LoRA用于LLM的记忆抵消

计算与语言 2026-03-03 v1 人工智能

摘要

大语言模型(LLM)已涵盖广泛领域的丰富知识。然而,控制大语言模型不应know的内容对于确保对齐和安全使用至关重要。然而,由于知识保留与遗忘之间模糊的边界,LLM的有效记忆抵消困难。由于持续的多域训练导致参数空间纠缠,这一挑战在激进的记忆抵消策略下尤其导致次要损伤。此外,针对数十亿参数的SOTA模型进行优化所需的计算开销还是一个额外的障碍。本文提出了ALTER框架,这是一个针对大语言模型的轻量级记忆抵消框架,以解决知识纠缠和记忆抵消效率两个挑战。ALTER通过两个阶段运行:(I)捕获高熵token通过LoRA中的共享A矩阵进行学习,随后(II)采用非对称LoRA架构,通过参数隔离和在目标子域内记忆抵消token来实现指定的遗忘目标。作为通过非对称框架实现token级隔离记忆抵消的新研究方向。ALTER在TOFU、WMDP和MUSE基准测试上实现了SOTA性能,忘记质量超过95%,同时通过保留基础token几乎没有副作用。通过将记忆抵消从大语言模型的十亿级参数中解耦,该框架在保持超过90%模型实用性方面实现了卓越的效率,显著超过基线保留率的47.8%-83.6%。

关键词

引用

@article{arxiv.2603.01792,
  title  = {ALTER: Asymmetric LoRA for Token-Entropy-Guided Unlearning of LLMs},
  author = {Xunlei Chen and Jinyu Guo and Yuang Li and Zhaokun Wang and Yi Gong and Jie Zou and Jiwei Wei and Wenhong Tian},
  journal= {arXiv preprint arXiv:2603.01792},
  year   = {2026}
}

备注

Accepted at The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)