中文

持续学习中混合专家模型的理论分析

机器学习 2025-02-20 v3 人工智能

摘要

持续学习(CL)因其能够适应随时间到达的新任务而受到广泛关注。已识别出在CL中适应新任务时遗忘旧任务(catastrophic forgetting)是一个主要问题。最近显示,混合专家(MoE)模型通过采用门控网络对稀疏化和分布不同任务于多个专家,从而有效缓解了持续学习中的灾难性遗忘。然而,针对MoE及其对CL学习性能影响的理论分析尚不充分。本文提供了首次对MoE在CL中影响进行特征化的理论结果,通过过参数化线性回归任务的视角进行分析。我们通过证明MoE模型能够使其专家针对不同任务进行专业化学习,同时其路由器学习为每个任务选择正确的专家并在所有专家之间均衡负载,证明了MoE相对于单一专家的优势。我们的研究进一步表明,MoE在CL中需要在充分的训练轮数后终止更新门控网络才能实现系统收敛,而这在不考虑持续任务到达的现有MoE研究中则不需要。此外,我们提供了预期遗忘和总体泛化误差的显式表达式,以特征化MoE在CL学习性能中的优势。有趣的是,增加专家数量需要更多的训练轮数才能实现收敛,这可能不会提高学习性能。最后,我们在合成数据和真实数据集上进行实验,将这些线性模型的洞见扩展到深度神经网络(DNNs),这些实验也为MoE在CL中的实际算法设计提供了启示。

关键词

引用

@article{arxiv.2406.16437,
  title  = {Theory on Mixture-of-Experts in Continual Learning},
  author = {Hongbo Li and Sen Lin and Lingjie Duan and Yingbin Liang and Ness B. Shroff},
  journal= {arXiv preprint arXiv:2406.16437},
  year   = {2025}
}

备注

This paper has been accepted by ICLR 2025 (Spotlight)