中文

论宽度对持续学习的边际收益递减

机器学习 2024-06-21 v3 人工智能

摘要

尽管深度神经网络在各种环境中展现出了突破性的性能,但当按序列在新任务上训练时,这些模型经常会遭受灾难性遗忘。已有几项工作通过实验证明,增加神经网络的宽度可以减少灾难性遗忘,但尚未刻画出宽度与持续学习之间的确切关系。我们设计了首批用于分析持续学习理论的框架之一,并证明了宽度与前馈网络(FFN)中的遗忘直接相关。具体而言,我们证明了增加网络宽度以减少遗忘会产生边际收益递减。我们在先前研究尚未探索的宽度下通过实验验证了我们的主张,在这些宽度下正如我们的理论所预测的那样,可以清楚地观察到边际收益递减。

关键词

引用

@article{arxiv.2403.06398,
  title  = {On the Diminishing Returns of Width for Continual Learning},
  author = {Etash Guha and Vihan Lakshman},
  journal= {arXiv preprint arXiv:2403.06398},
  year   = {2024}
}

备注

25 pages. ICML 2024