持续学习是否平等地遗忘所有参数?
机器学习
2023-04-11 v1
摘要
持续学习(CL)中的分布偏移(如任务或域偏移)通常会导致神经网络灾难性遗忘。尽管可通过重复回放缓冲数据来缓解,但逐步回放耗时较长。本文通过考察CL期间神经网络的训练动态,研究哪些模块更易遗忘。我们提出的指标表明,仅少数模块更具任务特异性且在任务间敏感变化,而其他模块可作为通用知识跨任务共享。因此,我们将遗忘主要归因于前者,并发现仅在任意CL方法结束时于小缓冲上微调这些模块即可带来显著改进。由于微调参数量小,此种“遗忘优先微调(FPF)”在计算上高效。我们进一步提出一种更高效简单的方法,彻底去除逐步回放,并以CL期间周期性触发的仅次FPF替代。令人惊讶的是,该“-FPF”表现与FPF相当,且优于SOTA CL方法,同时大幅降低计算开销与成本。在类增量与域增量CL的多个基准实验中,FPF持续大幅提升现有CL方法,而-FPF在精度不降前提下效率更优。我们还实证研究了缓冲大小、每任务轮数及微调模块对方法开销与精度的影响。
引用
@article{arxiv.2304.04158,
title = {Does Continual Learning Equally Forget All Parameters?},
author = {Haiyan Zhao and Tianyi Zhou and Guodong Long and Jing Jiang and Chengqi Zhang},
journal= {arXiv preprint arXiv:2304.04158},
year = {2023}
}