中文

深度网络中的持续学习:最后一层分析

机器学习 2022-08-19 v3 人工智能

摘要

我们研究深度神经网络的不同输出层参数化如何在持续学习设置中影响学习与遗忘。以下三种效应可在输出层引起灾难性遗忘:(1)权重修改,(2)干扰,以及(3)投影漂移。本文中,我们的目标是更深入地理解改变输出层参数化如何可解决(1)和(2)。此处提出并评估了针对这些问题的若干潜在解决方案,涵盖多种持续学习场景。我们表明,性能最优的输出层类型取决于数据分布漂移和/或可用数据量。特别地,在某些标准线性层会失败的情况下,改变参数化足以在不引入任何持续学习算法、而是使用标准SGD训练模型的情况下实现显著更优的性能。我们的分析与结果揭示了持续学习场景中输出层的动态特性,并提出了针对给定场景选择最佳输出层类型的方法。

关键词

引用

@article{arxiv.2106.01834,
  title  = {Continual Learning in Deep Networks: an Analysis of the Last Layer},
  author = {Timothée Lesort and Thomas George and Irina Rish},
  journal= {arXiv preprint arXiv:2106.01834},
  year   = {2022}
}