中文

MINGLE:用于测试时持续模型合并的空域门控低秩专家混合

机器学习 2025-10-23 v3 计算机视觉与模式识别

摘要

持续模型合并将独立微调的模型按顺序集成,而无需访问原始训练数据,提供了可扩展且高效的持续学习解决方案。然而,现有方法面临两个关键挑战:导致灾难性遗忘的参数在任务之间产生干扰,以及对不断演变的测试分布的适应性有限。为此,本文提出测试时持续模型合并 (TTCMM) 的任务,该任务在推理期间利用小量无标签测试样本以缓解参数冲突并处理分布迁移。我们提出了 MINGLE,一个针对 TTCMM 的新框架。MINGLE 采用基于参数高效低秩专家的混合专家架构,增强了对不断演变的测试分布的适应性,同时动态合并模型以缓解冲突。为进一步减少遗忘,我们提出了空域受限门控,该机制将门控更新限制在正交于先前任务表示的子空间内,从而抑制旧任务上的激活,保留过往知识。我们进一步引入了自适应松弛策略,该策略根据在测试时适应期间观察到的干扰信号动态调整约束强度,在稳定性和适应性之间取得平衡。在标准持续合并基准上的大量实验表明,MINGLE 实现了稳健的泛化,显著减少了遗忘,在各种任务顺序下均优于以前的最先进方法平均提升了 7-9%。我们的代码已公开:https://github.com/zihuanqiu/MINGLE

关键词

引用

@article{arxiv.2505.11883,
  title  = {MINGLE: Mixture of Null-Space Gated Low-Rank Experts for Test-Time Continual Model Merging},
  author = {Zihuan Qiu and Yi Xu and Chiyuan He and Fanman Meng and Linfeng Xu and Qingbo Wu and Hongliang Li},
  journal= {arXiv preprint arXiv:2505.11883},
  year   = {2025}
}

备注

accepted by NeurIPS 2025