重新审视用于持续学习的神经网络:架构视角
机器学习
2025-06-06 v3 计算机视觉与模式识别
摘要
克服灾难性遗忘的努力主要集中在开发更有效的持续学习 (CL) 方法上。相比之下,较少有关注致力于分析网络架构设计(例如网络深度、宽度和组件)对 CL 的作用。本文旨在弥合网络架构设计与 CL 之间的差距,并对网络架构对 CL 的影响进行全面研究。这项工作在网络缩放级别(即宽度和深度)以及网络组件级别(即跳跃连接、全局池化层和下采样)考虑架构设计。在这两种情况下,我们首先通过系统地探索架构设计如何影响 CL 来得出见解。然后,基于这些见解,我们为 CL 构建了专门的搜索空间,并进一步提出了一种简单而有效的 ArchCraft 方法来引导对 CL 友好的架构,即该方法将 AlexNet/ResNet 重构为 AlexAC/ResAC。在各种 CL 设置和场景下的实验验证表明,改进的架构具有参数高效性,在 Task IL 和 Class IL 中实现了 CL 的 SOTA 性能,同时参数量比朴素 CL 架构分别紧凑 86%、61% 和 97%。代码可在 https://github.com/byyx666/ArchCraft 获取。
引用
@article{arxiv.2404.14829,
title = {Revisiting Neural Networks for Continual Learning: An Architectural Perspective},
author = {Aojun Lu and Tao Feng and Hangjie Yuan and Xiaotian Song and Yanan Sun},
journal= {arXiv preprint arXiv:2404.14829},
year = {2025}
}