中文

基于动态稀疏训练的持续学习:探索有效模型更新的算法

机器学习 2023-12-05 v2 计算机视觉与模式识别

摘要

持续学习(CL)指的是智能系统以尽可能少的计算开销从数据流中顺序获取并保留知识的能力。为此,文献中引入了正则化、回放、架构和参数隔离方法。使用稀疏网络的参数隔离能够将为不同任务分配神经网络的特定部分,并且如果任务相似还允许在任务间共享参数。动态稀疏训练(DST)是寻找这些稀疏网络并为每个任务隔离它们的一种重要方式。本文是首个在 CL 范式下研究不同 DST 组件影响的实证研究,旨在填补关键研究空白,并阐明 DST 用于 CL 的最优配置(如果存在)。因此,我们进行了全面研究,在任务增量 CL 设置下于知名的 CIFAR100 和 miniImageNet 基准上考察各种 DST 组件以寻找每任务的最佳拓扑,因为我们的主要焦点是评估各种 DST 准则的性能,而非掩码选择过程。我们发现,在低稀疏度水平下,Erdos-Rényi Kernel(ERK)初始化更高效地利用骨干网络并允许有效学习任务的增量。在高稀疏度水平下,除非极端,均匀初始化展现出更可靠和鲁棒的性能。在增长策略方面,性能依赖于所定义的初始化策略和稀疏度程度。最后,DST 组件内的自适应性是构建更好持续学习器的有前景的途径。

关键词

引用

@article{arxiv.2308.14831,
  title  = {Continual Learning with Dynamic Sparse Training: Exploring Algorithms for Effective Model Updates},
  author = {Murat Onur Yildirim and Elif Ceren Gok Yildirim and Ghada Sokar and Decebal Constantin Mocanu and Joaquin Vanschoren},
  journal= {arXiv preprint arXiv:2308.14831},
  year   = {2023}
}