中文

面向持续模型合并的整体方法

机器学习 2026-02-23 v2 人工智能

摘要

我们提出了一种针对持续模型合并(CMM)的整体框架,该框架在三个关键阶段发挥作用:合并前、合并过程中以及合并后,以解决持续学习中的两个根本性挑战。具体而言,传统方法要么维护一个不断增长的每个领域任务向量列表,导致可扩展性问题;要么仅依赖权重空间合并,当旧数据不可访问时,导致丢失关键功能信息。我们的方法通过首先在域特定数据上对主模型进行切向空间内的微调;这种线性化放大了每个任务的权重非紧凑,有效缓解了跨任务干扰。在合并阶段,我们利用可用优化器状态中的功能信息,远超参数平均值,从而无需重新访问旧数据。最后,一个合并后校正机制对预合并模型和后合并模型之间的表示差异进行对齐,减少偏差并提升整体性能——在不访问历史数据的情况下以恒定的内存运行。针对标准的类递增和域递增基准进行大量实验表明,我们的方法不仅实现了竞争性能,还提供了一种可扩展且高效的解决遗忘问题的方法。

关键词

引用

@article{arxiv.2509.23592,
  title  = {Toward a Holistic Approach to Continual Model Merging},
  author = {Hoang Phan and Sungmin Cha and Tung Lam Tran and Qi Lei},
  journal= {arXiv preprint arXiv:2509.23592},
  year   = {2026}
}

备注

Accepted to Workshop on Continual Learning in Computer Vision, ICCV 2025