面向大型视觉语言模型中混合专家的长尾分布感知路由器
计算机视觉与模式识别
2026-04-03 v2
摘要
混合专家 (MoE) 架构通过用稀疏网络取代稠密网络,已成为大型视觉语言模型 (LVM) 中引人注目的研究热点,旨在在激活远较少参数的情况下实现相当的性能。现有LVM的混合专家架构主要关注token到专家路由 (TER),鼓励不同专家专注于处理特定token。但这些方法通常依赖负载平衡机制,忽略了视觉与语言模态之间固有的分布差异。为此,我们提出了面向视觉语言TER的长尾分布感知路由器 (LTDR),以解决两个关键挑战:(1) 模态特定的分布感知路由。我们观察到语言TER通常遵循相对均匀的分布,而视觉TER则表现为长尾分布。这种模态差异激发了为每种模态设计专门路由策略的动机。(2) 视觉特定的动态专家激活。认识到高信息视觉尾部token的重要性,我们引入一种受数据增强启发的策略,通过增加激活专家的数量,确保这些稀有但信息丰富的token得到充分学习。在视觉语言和视觉基准测试中,我们的方法实现了持续的性能提升,分别在视觉语言和视觉基准测试中提升了1.2%/2.1%和1.6%。
引用
@article{arxiv.2507.01351,
title = {Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model},
author = {Chaoxiang Cai and Longrong Yang and Minghe Weng and Xuewei Li and Zequn Qin and Xi Li},
journal= {arXiv preprint arXiv:2507.01351},
year = {2026}
}