持续学习性能中信息流的理论理解
机器学习
2022-05-04 v2
摘要
持续学习(CL)是一种智能体必须从连续传入的数据流中顺序学习的设定。CL性能评估模型随时间利用增量可用信息持续学习并解决新问题的能力,同时保留先前知识。尽管先前已有众多解决方案来规避学习过程中对已见任务的灾难性遗忘(CF),但大多数仍遭受显著的遗忘、高昂的内存成本,或缺乏对神经网络学习新任务时行为的理论理解。虽然CL性能在不同训练机制下退化的经验研究已广泛开展,但从理论角度的关注仍不充分。本文中,我们建立了一个概率框架,以分析网络中各层在任务序列上的信息流及其对学习性能的影响。我们的目标是在学习新任务时优化层间信息保持,以管理特定任务知识在各层间的传递,同时保持模型在先前任务上的性能。特别地,我们研究CL性能与网络中信息流的关系,以回答“如何利用层间信息流知识来缓解CF?”这一问题。我们的分析提供了增量任务学习过程中层内信息适应的新见解。通过实验,我们提供了经验证据并实际突出了跨多个任务的性能提升。
引用
@article{arxiv.2204.12010,
title = {Theoretical Understanding of the Information Flow on Continual Learning Performance},
author = {Josh Andle and Salimeh Yasaei Sekeh},
journal= {arXiv preprint arXiv:2204.12010},
year = {2022}
}
备注
7 figures, 16 pages