中文

SparCL:边缘设备上的稀疏持续学习

机器学习 2022-09-21 v1 人工智能 计算机视觉与模式识别

摘要

现有的持续学习(CL)工作侧重于缓解灾难性遗忘,即在学习新任务时模型在旧任务上的性能退化。然而,CL系统的训练效率未被充分研究,这限制了CL系统在资源受限场景下的实际应用。本文提出一种称为稀疏持续学习(SparCL)的新框架,这是首个利用稀疏性在边缘设备上实现高性价比持续学习的研究。SparCL通过三方面的协同实现训练加速与精度保持:权重稀疏性、数据效率与梯度稀疏性。具体而言,我们提出任务感知动态掩码(TDM)以在整个CL过程中学习稀疏网络,动态数据移除(DDR)以剔除信息量较少的训练数据,以及动态梯度掩码(DGM)以稀疏化梯度更新。三者不仅各自提升效率,还进一步缓解灾难性遗忘。SparCL将现有最优(SOTA)CL方法的训练效率一致提升,最多减少23倍训练FLOPs,且出人意料地进一步将SOTA精度提升最多1.7%。SparCL在效率与精度上均优于将SOTA稀疏训练方法适配至CL设定所得的强基线。我们还在真实手机上评估了SparCL的有效性,进一步表明本方法的实际潜力。

关键词

引用

@article{arxiv.2209.09476,
  title  = {SparCL: Sparse Continual Learning on the Edge},
  author = {Zifeng Wang and Zheng Zhan and Yifan Gong and Geng Yuan and Wei Niu and Tong Jian and Bin Ren and Stratis Ioannidis and Yanzhi Wang and Jennifer Dy},
  journal= {arXiv preprint arXiv:2209.09476},
  year   = {2022}
}

备注

Published at NeurIPS 2022 as a conference paper