中文

通过任务感知专家混合解决统一模型中的任务目标冲突

计算机视觉与模式识别 2025-10-07 v2

摘要

基于端到端自回归(AR)变换器的统一多模态大语言模型(MLLM)能够有效在单一框架内整合理解与生成任务。然而,理解中的高层语义抽象与生成中的细粒度细节保持之间的内在任务目标冲突带来了重大挑战,常常导致次优权衡和任务干扰。现有的解决方案,如解耦共享视觉编码器,由于AR架构的固有特性,无法从根本上解决这些冲突。在本文中,我们提出了一种通过解耦AR内部组件来解决任务目标冲突的新方法。具体而言,我们设计了UTAMoE,一个统一的任务感知专家混合(MoE)框架,通过任务感知MoE层解耦内部AR模块,创建任务特定的优化子路径。为了在保持整体协调的同时增强任务区分度,我们引入了一种新颖的两阶段训练策略。在多模态基准上的广泛实验表明,UTAMoE缓解了任务目标冲突,在各项任务上取得了最先进性能。可视化和消融研究进一步验证了我们方法的有效性。

关键词

引用

@article{arxiv.2506.03591,
  title  = {Resolving Task Objective Conflicts in Unified Model via Task-Aware Mixture-of-Experts},
  author = {Jiaxing Zhang and Hao Tang},
  journal= {arXiv preprint arXiv:2506.03591},
  year   = {2025}
}