中文

通过双层路由混合专家(BR-MoE)扩展持续学习至 300+ 任务

机器学习 2026-05-11 v2 计算机视觉与模式识别

摘要

持续学习,特别是以预训练模型(PTM)为基础的类别增量学习(CIL),近年来引发了广泛关注。然而,如何在非常长的任务序列中有效学习判别性和全面性的特征表示,同时保持稳定性和塑性性,仍是一个开放问题。我们提出了 CaRE,即可扩展的 {C}ontinual Le{a}rner with efficient Bi-Level {R}outing Mixture-of-{E}xperts(高效双层路由混合专家)。BR-MoE 的核心思想是双层路由机制:一个路由选择阶段动态激活相关的任务特定路由器,随后是一个专家路由阶段动态激活和聚合专家,旨在将判别性和全面性的表示注入到每个中间网络层中。另一方面,我们引入了一个具有挑战性的数据集 OmniBenchmark-1K,用于评估在非常长的任务序列(包含数百个任务)上的 CIL 性能。大量实验表明,CaRE 在各种数据集和任务设置下均表现卓越,包括常用 CIL 数据集上的经典 CIL 设置(如 5-20 个任务)。据我们所知,CaRE 是首个扩展到非常长的任务序列(从 100 个到超过 300 个不相交任务)的持续学习方法,在此类任务序列上 outperform 了所有基线方法。我们希望本工作能激发进一步的研究,以应对极端长任务序列的持续学习。代码和数据集已公开发布于 https://github.com/LMMMEng/CaRE。

关键词

引用

@article{arxiv.2602.03473,
  title  = {Scaling Continual Learning to 300+ Tasks with Bi-Level Routing Mixture-of-Experts},
  author = {Meng Lou and Yunxiang Fu and Yizhou Yu},
  journal= {arXiv preprint arXiv:2602.03473},
  year   = {2026}
}

备注

Accepted by ICML 2026