中文

为遗忘寻面:持续学习 meets 机制可解释性

机器学习 2026-04-21 v2

摘要

持续学习中的灾�性遗忘往往在性能或最后一层表征层面进行测量,忽略了底层机制。我们引入一种机制框架,提供对灾难性遗忘的几何解释,将其视为对单个特征编码的变换结果。这些变换可能通过减少特征分配的容量或干扰其由下游计算读取来导致遗忘。分析一个可解析的玩具模型以形式化此观点,使我们能够识别最佳和最差情况。通过在该模型上进行实验,我们经验性测试我们的形式化分析,突出深度的劣势作用。最终,我们展示我们的框架如何用于实用模型分析,通过 Crosscoders 实现。我们通过一个在顺序 CIFAR-10 上训练的 Vision Transformer 的案例研究来实现此目的。我们的工作为持续学习提供了新的以特征为中心的词汇表。

关键词

引用

@article{arxiv.2601.22012,
  title  = {Putting a Face to Forgetting: Continual Learning meets Mechanistic Interpretability},
  author = {Sergi Masip and Gido M. van de Ven and Javier Ferrando and Tinne Tuytelaars},
  journal= {arXiv preprint arXiv:2601.22012},
  year   = {2026}
}