中文

缓解统一多模态模型持续学习中的模态内与模态间遗忘

机器学习 2025-12-04 v1 人工智能

摘要

统一多模态生成模型(UMGM)在单一自回归框架中统一了视觉理解与图像生成。然而,其持续学习新任务的能力受到灾难性遗忘的严重阻碍,既包括模态内遗忘(intra-modal),也包括模态间遗忘(inter-modal)。虽然模态内遗忘已在先前的持续学习(CL)工作中被研究,但模态间遗忘仍基本未被探索。在本文中,我们识别并经验性地验证了UMGM中的这一现象,并提供了基于模态间梯度冲突的理论解释。为解决模态内和模态间遗忘,我们提出了模态解耦专家(Modality-Decoupled Experts, MoDE),一种轻量且可扩展的架构,通过隔离模态特定更新来缓解梯度冲突,并利用知识蒸馏来防止灾难性遗忘和保持预训练能力。与先前保持模态耦合并受模态梯度冲突困扰的CL方法不同,MoDE明确地解耦模态以防止干扰。在多样化基准上的实验表明,MoDE显著缓解了模态间和模态内遗忘,在统一多模态生成设置中优于先前的CL基线。代码将公开发布:https://github.com/Christina200/MoDE-official.git

关键词

引用

@article{arxiv.2512.03125,
  title  = {Mitigating Intra- and Inter-modal Forgetting in Continual Learning of Unified Multimodal Models},
  author = {Xiwen Wei and Mustafa Munir and Radu Marculescu},
  journal= {arXiv preprint arXiv:2512.03125},
  year   = {2025}
}

备注

NeurIPS 2025