中文

基于归因的神经元效用用于深度网络中的可塑性恢复

机器学习 2026-05-11 v1

摘要

持续学习研究试图保留两项基本能力:新知识的获取与先前所学知识的保持。虽然在此情况下知识可以通过在隐式或显式任务空间上的性能来衡量,但模型可塑性通常涉及数据分布演变时的适应能力。尽管文献多关注灾难性遗忘,但深度网络也可能遭受可塑性丧失,在持续训练下变得越来越难以更新。近期研究发现了该现象背后的多种机制,包括神经元饱和、参数范数增长以及有用曲率方向的丢失。基于自适应重置的干预措施通过选择性重新初始化低效用网络参数,已成为恢复可训练性的实用解决方案。用于指导重置的现有效用度量,如激活幅度、贡献效用或基于梯度的活动,依赖于可能与本应指导的干预措施不一致的代理信号。在本文中,我们引入了梯度乘以与参考的差异(gradient times difference from reference, GXD),这是一种基于参考梯度归因的理论驱动的效用度量,用于估计替换单元的一阶功能成本。我们的结果表明,与重置功能成本一致的效用度量可以在现有重置标准退化的环境中使干预更加可靠。GXD 将自适应重置重新构建为干预成本估计问题,为更鲁棒的持续学习系统提供了一条实用途径。

关键词

引用

@article{arxiv.2605.06834,
  title  = {Attribution-Based Neuron Utility for Plasticity Restoration in Deep Networks},
  author = {Patrick Elisii and Lucas Beauchemin and Dawer Jamshed},
  journal= {arXiv preprint arXiv:2605.06834},
  year   = {2026}
}