令牌困境:面向大型视觉语言模型持续学习的动态混合专家,具漂移感知的令牌分配
机器学习
2026-03-31 v1 人工智能
摘要
多模态持续指令调优旨在通过学习新数据而不忘记先前学习的知识来持续提升大型视觉语言模型 (LVM)。混合专家 (MoE) 架构天然支持这一点,通过增量添加新的专家和扩展路由器,同时保持现有专家冻结。然而,尽管专家是隔离的,基于 MoE 的持续学习者仍因路由漂移而遗忘旧任务:旧任务的令牌被误导性地吸引到新添加的专家,从而损害先前任务的性能。我们在令牌层面分析了这种失效模式,揭示了令牌困境:来自新任务数据中的模糊和旧令牌学习收益最小,却因在训练期间的模糊路由分配被路由到新专家而引发遗忘。针对此现象,我们提出了 LLaVA-DyMoE,一种具漂移感知令牌分配的动态 MoE 框架,用于增量扩充 MoE。我们通过令牌路由得分分布对令牌类型进行表征,并应用针对性的正则化。具体而言,令牌级分配指导将模糊和旧令牌引导远离新专家,以保留既定的路由模式并缓解路由漂移;同时,互补的路由得分正则化 enforces 专家组间分离并促进新专家的专业化。大量实验表明,LLaVA-DyMoE 有效缓解了路由漂移导致的遗忘,在平均最终准确率上提升超过 7%,遗忘率降低约 12%。项目页面为 https://zhaoc5.github.io/DyMoE。
引用
@article{arxiv.2603.27481,
title = {On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models},
author = {Chongyang Zhao and Mingsong Li and Haodong Lu and Dong Gong},
journal= {arXiv preprint arXiv:2603.27481},
year = {2026}
}
备注
Accepted at CVPR 2026