中文

范围:选择性跨模态编排视觉感知专家

计算机视觉与模式识别 2025-10-20 v2

摘要

视觉语言模型(VLM)受益于多个视觉编码器,但 naively 将其堆叠会导致报酬递减,同时增加推理成本。我们提出 SCOPE,一种 Mixture-of-Encoders(MoEnc)框架,通过实例级路由动态选择每个图像-文本对的最佳编码器,不同于传统 MoE 的 token 级路由。SCOPE 维护一个共享编码器和一组路由编码器。轻量级路由器利用文本提示与共享视觉特征之间的跨注意力机制,从路由编码器中选择最优编码器。为训练此路由器,我们引入双熵正则化及辅助损失,以平衡数据集级负载分布与实例级路由置信度。惊人的是,SCOPE 使用一个共享编码器加上一个路由编码器,即可战胜同时使用全部 4 个额外编码器的模型,计算成本降低 24-49%。这表明智能编码器选择优于蛮力聚合,挑战了多编码器 VLM 中的主流范式。

关键词

引用

@article{arxiv.2510.12974,
  title  = {Scope: Selective Cross-modal Orchestration of Visual Perception Experts},
  author = {Tianyu Zhang and Suyuchen Wang and Chao Wang and Juan Rodriguez and Ahmed Masry and Xiangru Jian and Yoshua Bengio and Perouz Taslakian},
  journal= {arXiv preprint arXiv:2510.12974},
  year   = {2025}
}

备注

14 pages, 2 figures