挑战关于灾难性遗忘的普遍假设
机器学习
2023-05-17 v2 人工智能
摘要
构建能够逐步学习并积累知识的学习智能体是持续学习(CL)研究领域的核心目标。遗憾的是,在新数据上训练模型通常会损害对过去数据的性能。在CL文献中,这种效应被称为灾难性遗忘(CF)。CF已被广泛研究,并提出了大量方法来应对短序列、非重叠任务上的该问题。在此类设定中,CF总会导致过去任务性能的迅速且显著下降。然而,尽管存在CF,近期工作表明在CL回归设定下,对线性模型用SGD训练可积累知识。当任务重复出现时,该现象尤为明显。我们不禁疑问:用SGD或任何标准基于梯度的优化训练的DNN是否也以这种方式积累知识。此类现象若成立,将对DNN应用于真实持续场景产生有趣影响。事实上,标准基于梯度的优化方法比现有CL算法计算开销显著更低。本文中,我们研究在长任务序列、数据重复出现条件下,用基于梯度算法训练的DNN中的渐进知识积累(KA)。我们提出新框架SCoLe(Scaling Continual Learning)来研究KA,并发现用SGD训练的DNN上灾难性遗忘影响有限。当在稀疏重复出现的长序列上训练时,总体准确率提升,鉴于CF现象这或许有违直觉。我们从经验上考察了不同数据出现频率下DNN中的KA,并提出简单可扩展策略以增强DNN中的知识积累。
引用
@article{arxiv.2207.04543,
title = {Challenging Common Assumptions about Catastrophic Forgetting},
author = {Timothée Lesort and Oleksiy Ostapenko and Diganta Misra and Md Rifat Arefin and Pau Rodríguez and Laurent Charlin and Irina Rish},
journal= {arXiv preprint arXiv:2207.04543},
year = {2023}
}