中文

CoME-VL:扩展互补多编码视觉语言学习

计算机视觉与模式识别 2026-04-06 v1

摘要

最近的视觉语言模型( VLM)通常依赖单一视觉编码器通过对比式图像-文本目标进行训练,如CLIP式预训练。虽然对比编码器对跨模态对齐和检索有效,但自监督视觉编码器往往捕获更丰富的稠密语义并在识别和理解任务中表现出更强的鲁棒性。本文我们调查如何扩展这些互补视觉表征的融合以进行视觉语言建模。我们提出CoME-VL:互补多编码视觉语言,一个模块化融合框架,将对比式训练的视觉编码器与自监督DINO编码器集成。我们的方法通过( i) 基于熵引导的多层聚合,结合正交约束投影以减少冗余,以及( ii) 增强RoPE的跨注意力机制,对异构token网格进行对齐并产生紧凑的融合视觉token。融合后的token可以注入解码器-only LLM,需对标准VLM管线进行最小修改。广泛的实验在多样化视觉语言基准测试中表明,CoME-VL consistently优于单编码器基线。在特别是,我们观察到在视觉理解任务上平均提高4.9%,在定位任务上提高5.4%。本方法在RefCOCO上实现最先进的检测性能,同时显著超过基线。最后,我们对层合并、非冗余特征混合和融合容量进行消融研究,以评估互补对比和自监督信号如何影响VLM性能。

关键词

引用

@article{arxiv.2604.03231,
  title  = {CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning},
  author = {Ankan Deria and Komal Kumar and Xilin He and Imran Razzak and Hisham Cholakkal and Fahad Shahbaz Khan and Salman Khan},
  journal= {arXiv preprint arXiv:2604.03231},
  year   = {2026}
}

备注

16 pages, 10 figures, 5 tables