中文

稀疏自编码器引导的大型语言模型内部表示忘却

计算与语言 2025-09-22 v1 机器学习

摘要

随着大型语言模型(LLM)在 various applications 中广泛部署,隐私和版权问题日益突出,亟需更有效的 LLM 忘却技术。许多现有的忘却方法旨在通过额外训练(例如梯度上升)来抑制不希望的输出,从而降低生成此类输出的概率。虽然此类抑制性方法可控制模型输出,但可能无法消除模型内部激活中嵌入的底层知识;静音一种响应并不等同于忘却它。此外,此类抑制性方法常常 suffer from 模型崩溃。为解决这些问题,我们提出了一种直接干预模型内部激活的新型忘却方法。在我们的公式中,忘却被定义为目标激活与“未知”实体激活无差别的状态。我们的方法引入一种忘却目标函数,在稀疏自编码器潜在空间中,将目标实体的激活从已知实体的激活中偏移,并向未知实体的激活移动,从而通过对齐目标的内部激活与未知实体的激活,将模型对目标实体的识别从“已知”转为“未知”,实现真正的忘却,同时避免过度抑制和模型崩溃。实验结果表明,我们的方法有效地对齐了被忘却目标的内部激活,此结果是抑制性方法难以实现的。此外,我们的方法在不损害非目标知识的前提下,有效降低了模型在问答任务中对目标知识的回忆。

关键词

引用

@article{arxiv.2509.15631,
  title  = {Sparse-Autoencoder-Guided Internal Representation Unlearning for Large Language Models},
  author = {Tomoya Yamashita and Akira Ito and Yuuki Yamanaka and Masanori Yamada and Takayuki Miura and Toshiki Shibahara},
  journal= {arXiv preprint arXiv:2509.15631},
  year   = {2025}
}