中文

MOVE:面向领域的视觉-语言处理的混合视觉编码器方法

计算机视觉与模式识别 2025-02-24 v1

摘要

多模态语言模型(MLMs)通过将视觉编码器与大语言模型通过特定适配器耦合来整合视觉和文本信息。虽然已有方法通常依赖单一预训练视觉编码器,但存在大量可提升模型在不同领域中性能的专业化编码器。在本工作中,我们提出了 MOVE(Mixture of Vision Encoders),一种简单而有效的方法,用于在多个预训练编码器中利用专业化的多模态任务。MOVE 自动将输入路由到候选编码器中最合适的编码器,如 Unichat、InternViT 和 Texify,从而在包括 ChartQA、MMBench 和 MMMU 在内的多样化基准测试中提升性能。实验结果表明,MOVE 在不增加高分辨率图像切片复杂性的前提下,实现了具竞争力的准确率。

关键词

引用

@article{arxiv.2502.15381,
  title  = {MOVE: A Mixture-of-Vision-Encoders Approach for Domain-Focused Vision-Language Processing},
  author = {Matvey Skripkin and Elizaveta Goncharova and Dmitrii Tarasov and Andrey Kuznetsov},
  journal= {arXiv preprint arXiv:2502.15381},
  year   = {2025}
}

备注

10 pages, 6 figures, 4 tables