中文

从逻辑值到潜在表示:面向LLM忘卸的对比表示塑形

机器学习 2026-01-30 v1

摘要

大多数LLM忘卸方法旨在通过最小化分布偏移来近似重新从头训练的行为,常采用对齐风格目标于预测空间。虽然有效减少了被遗忘内容的生成,但此类方法可能表现为抑制:被遗忘的概念可能在表示中持续存在,并与保留知识交织在一起。我们提出CLReg,对比表示正则化器,识别忘卸特征并将其与保留特征远离,显式减少忘卸-保留干扰,同时对保留特征实现最小偏移。我们提供首个理论见解,将表示塑形与去交织联系起来。跨越忘卸基准和不同规模的LLM,CLReg降低了忘卸-保留表示的交织程度,促进了主流忘卸方法的实施,同时无需额外隐私风险,为通过重塑表示空间以去除遗忘概念的未来工作指明了方向。

关键词

引用

@article{arxiv.2601.22028,
  title  = {From Logits to Latents: Contrastive Representation Shaping for LLM Unlearning},
  author = {Haoran Tang and Rajiv Khanna},
  journal= {arXiv preprint arXiv:2601.22028},
  year   = {2026}
}