TAG-MoE:面向统一生成式混合专家的任务感知门控
计算机视觉与模式识别
2026-03-27 v2 人工智能
摘要
统一的图像生成和编辑模型在稠密扩散变换器架构中面临严重的任务干扰问题,其中共享的参数空间必须在相互冲突的目标之间进行妥协(例如局部编辑与主题驱动生成)。尽管稀疏混合专家(MoE)范式是一个有前景的解决方案,但其门控网络仍是任务不可感知的,仅基于局部特征运行,缺乏对全局任务意图的了解。这种任务不可感知的性质阻碍了有意义的专业化,并未解决根本性的任务干扰。本文提出了一种将语义意图注入 MoE 路由的新框架。我们引入了分层任务语义注释方案,以创建结构化的任务描述符(例如范围、类型、保留)。我们随后设计了预测对齐正则化,以将内部路由决策与任务的高层语义进行对齐。这种正则化将门控网络从任务不可感知的执行者演变为调度中心。我们的模型有效缓解了任务干扰,在忠实度和质量方面优于稠密基线,而我们的分析表明,专家自然会发展出清晰且与语义相关的专业化。
引用
@article{arxiv.2601.08881,
title = {TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts},
author = {Yu Xu and Hongbin Yan and Juan Cao and Yiji Cheng and Tiankai Hang and Runze He and Zijin Yin and Shiyi Zhang and Yuxin Zhang and Jintao Li and Chunyu Wang and Qinglin Lu and Tong-Yee Lee and Fan Tang},
journal= {arXiv preprint arXiv:2601.08881},
year = {2026}
}
备注
Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/