中文

理解遗忘难度:一种机制视角与电路引导的难度度量

机器学习 2026-01-15 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

机器遗忘对于构建可信赖且合规的语言模型正变得至关重要。然而,遗忘的成功率在不同样本间差异很大:有些样本能被可靠地擦除,而另一些尽管经过相同过程却依然存在。我们认为,这种差异不仅是一种数据侧现象,也反映了编码和保护记忆信息的模型内部机制。我们从基于模型电路的机制视角研究此问题——电路是控制预测如何形成的结构化交互路径。我们提出了电路引导的遗忘难度(CUD),这是一种预遗忘度量,利用电路级信号为每个样本分配一个连续的难度分数。大量实验表明,CUD 能可靠地区分内在容易和困难的样本,并且在不同的遗忘方法中保持稳定。我们识别出揭示难度机制特征的关键电路级模式:容易遗忘的样本与集中在原始模型早期到中间部分的更短、更浅的交互相关,而困难样本则依赖于更接近后期计算的更长、更深的路径。与现有的定性研究相比,CUD 朝着对遗忘难度进行原则性、细粒度和可解释分析迈出了第一步,并激励了基于模型机制的遗忘方法的发展。

关键词

引用

@article{arxiv.2601.09624,
  title  = {Toward Understanding Unlearning Difficulty: A Mechanistic Perspective and Circuit-Guided Difficulty Metric},
  author = {Jiali Cheng and Ziheng Chen and Chirag Agarwal and Hadi Amiri},
  journal= {arXiv preprint arXiv:2601.09624},
  year   = {2026}
}