多任务与持续学习中的线性模式连通性
机器学习
2020-10-12 v1 人工智能
计算机视觉与模式识别
摘要
持续(顺序)训练与多任务(同时)训练往往试图解决同一总体目标:找到在所有考虑任务上均表现良好的解。主要区别在于训练机制,持续学习每次只能访问一个任务,对于神经网络这通常导致灾难性遗忘。即,为后续任务找到的解在先前任务上不再表现良好。然而,两种训练机制所到达的不同极小值之间的关系尚不清楚。是什么使它们区分开来?是否存在可解释两种方案性能差异的局部结构?受近期工作启发——同一任务的不同极小值通常由低误差的极简单曲线相连,我们探究多任务解与持续解是否类似地连通。我们经验性地发现这种连通性确实可稳定实现,且更有趣的是,在两者具有相同初始化条件下可通过线性路径实现。我们深入分析了该现象并讨论其对持续学习过程的意义。此外,我们利用此发现提出一种有效算法,约束顺序学习的极小值表现得如同多任务解。我们表明该方法在各种视觉基准上优于多种最先进的持续学习算法。
引用
@article{arxiv.2010.04495,
title = {Linear Mode Connectivity in Multitask and Continual Learning},
author = {Seyed Iman Mirzadeh and Mehrdad Farajtabar and Dilan Gorur and Razvan Pascanu and Hassan Ghasemzadeh},
journal= {arXiv preprint arXiv:2010.04495},
year = {2020}
}