中文

Split-on-Share:面向任务无关性持续学习的稀疏专家混合模型

机器学习 2026-05-05 v2

摘要

大语言模型(LLM)的持续学习受到塑性-稳定性困境的制约,即获取新能力往往会导致对先前知识的灾难性遗忘。现有方法通常对参数统一处理,无法区分特定任务知识与共享能力。我们引入一种用于任务无关性持续学习的稀疏专家混合模型,称为 SETA(Sparse Experts for Task-Agnostic Continual Learning),该框架通过将模型分解为模块化子空间来解决塑性-稳定性冲突。与标准更新不同,任务之间为相同参数争夺,SETA 将知识分为唯一的专家,以隔离任务特定模式,以及负责捕获通用特征的共享专家。这种结构通过弹性权重锚定得以维持,该方法保护关键共享知识,并 enables 统一的门控网络在推理时自动检索每个任务所需的正确专家组合。广泛的实验在各种领域特定和通用基准上表明,SETA 在持续学习中 consistently 优于基于参数高效微调的方法。

关键词

引用

@article{arxiv.2601.17616,
  title  = {Split-on-Share: Mixture of Sparse Experts for Task-Agnostic Continual Learning},
  author = {Fatema Siddika and Md Anwar Hossen and Tanwi Mallick and Ali Jannesari},
  journal= {arXiv preprint arXiv:2601.17616},
  year   = {2026}
}

备注

we are updating the paper and will release another version soon