中文

克服持续学习中归一化统计的近因偏差:平衡与适应

机器学习 2023-10-16 v1

摘要

持续学习需要学习一系列任务并恰当平衡其知识。在旧训练样本访问受限的情况下,当前深度神经网络的大量工作集中于克服基于梯度的优化中旧任务的灾难性遗忘。然而,归一化层是一个例外,因为它们由梯度和当前观测训练样本的统计 interdependent 更新,需要专门策略来缓解近因偏差。在本工作中,我们关注最流行的批归一化(Batch Normalization, BN),并就其于持续学习中的次优性提供深入理论分析。我们的分析揭示了增量任务的 BN 统计在平衡与适应之间的两难困境,这可能影响训练稳定性与泛化性。针对这些特定挑战,我们提出了自适应平衡 BN (Adaptive Balance of BN, AdaB2^2N),其适当地结合了基于贝叶斯的策略以适应任务级贡献,以及一种改进的动量来平衡 BN 统计,分别对应训练与测试阶段。通过以持续学习方式实现 BN,我们的方法在广泛基准上取得显著性能提升,尤其是在具挑战性但现实的在线场景(例如,在 Split CIFAR-10、Split CIFAR-100 和 Split Mini-ImageNet 上分别最高达 7.68%、6.86% 和 4.26%)。我们的代码见 https://github.com/lvyilin/AdaB2N。

关键词

引用

@article{arxiv.2310.08855,
  title  = {Overcoming Recency Bias of Normalization Statistics in Continual Learning: Balance and Adaptation},
  author = {Yilin Lyu and Liyuan Wang and Xingxing Zhang and Zicheng Sun and Hang Su and Jun Zhu and Liping Jing},
  journal= {arXiv preprint arXiv:2310.08855},
  year   = {2023}
}

备注

Accepted by NeurIPS 2023