中文

VEN-VL:一种面向有效与高效多模态理解的视觉集成混合专家框架

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

尽管近期高效方法在加速多模态理解方面取得了显著进展,但仍存在明显的性能下降。这些方法强调单一视觉线索的高压缩比,并依赖于粗糙注意力对齐的启发式修剪策略,导致视觉标记的信息容量和密度瓶颈。为此,我们提出 VEN-VL,一种遵循“丰富后压缩”原则的视觉集成混合专家框架,用于有效且高效的感知。具体而言,我们首先通过统一不同视角的视觉表示来增强信息容量,然后通过特定视觉专家中的自适应路由器逐步压缩信息密度。此外,我们通过显式视觉监督纳入 vanilla 结构的重建能力,以促进关键信息的保留。实验结果表明,我们在信息被压缩的标记较少的复杂视觉任务中表现出优势,有效弥合了性能与效率之间的差距。

关键词

引用

@article{arxiv.2605.25952,
  title  = {VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding},
  author = {Yinghao Wu and Zhuoyan Luo and Yiyao Yu and Zhaojian Yu and Yujiu Yang and Xiao-Ping Zhang},
  journal= {arXiv preprint arXiv:2605.25952},
  year   = {2026}
}