中文

持续学习中正则化方法的统一

机器学习 2021-02-05 v2 机器学习

摘要

持续学习应对按顺序学习若干不同任务的挑战。在不重新访问旧任务的情况下保持对其知识的这一目标,与人工神经网络的标准 SGD 训练尖锐冲突。解决此问题且不存储旧数据的一类有影响力的方法是所谓的正则化方法。它们度量每个参数对解决给定任务的重要性,随后保护重要参数免于大幅改变。文献中提出了三种度量参数重要性的方式,并启发了大量后续工作。本文给出强有力的理论与实证证据,表明这三种方法——弹性权重巩固(EWC)、突触智能(SI)和记忆感知突触(MAS)——出奇地相似,且都关联到同一理论量。具体而言,我们表明,尽管动机迥异,SI 与 MAS 均近似 Fisher 信息的平方根,而 Fisher 信息是 EWC 理论依据的基础。此外,我们表明对 SI 而言,其与 Fisher 的关系——事实上其性能——源于一个先前未知的方差偏置。除了揭示未知相似性并统一正则化方法外,我们还证明这些见解能带来大批量训练中的实际性能提升。

关键词

引用

@article{arxiv.2006.06357,
  title  = {Unifying Regularisation Methods for Continual Learning},
  author = {Frederik Benzing},
  journal= {arXiv preprint arXiv:2006.06357},
  year   = {2021}
}