中文

神经网络中基于梯度下降的持续学习理论

机器学习 2026-04-21 v2 信息论 机器学习 math.IT

摘要

持续学习是指模型能够在不忘记先前任务的前提下适应一系列任务的能力,这是人工智能的核心目标。为了更好地理解其背后的机制,我们研究了持续学习在一个可具象且具代表性的设置下的局限性。具体而言,我们分析了在一系列具有高斯噪声的XOR聚类数据集上通过梯度下降训练的单隐藏层二次神经网络,其中不同任务对应于均值正交的聚类。我们的分析基于对训练损失梯度下降动力学的紧密刻画,由此得出关于训练时遗忘率的显式上界,这些上界是迭代次数、样本大小、任务数量和隐藏层宽度的函数。我们 then 利用算法稳定性框架来界定泛化间隙,进而得到关于测试时遗忘的相应保证。我们的结果提供了持续学习中遗忘的第一个闭形式保证,并展示了关键问题参数如何共同支配遗忘动力学。数值实验证实了我们的理论结果。

关键词

引用

@article{arxiv.2510.05573,
  title  = {On the Theory of Continual Learning with Gradient Descent for Neural Networks},
  author = {Hossein Taheri and Avishek Ghosh and Arya Mazumdar},
  journal= {arXiv preprint arXiv:2510.05573},
  year   = {2026}
}