中文

OpenVision:一个用于多模态学习的完全开放、高性价比的先进视觉编码器系列

计算机视觉与模式识别 2025-05-08 v1

摘要

OpenAI 的 CLIP 于 2021 年初发布,长期以来一直是构建多模态基础模型的首选视觉编码器。尽管 SigLIP 等近期替代方案已开始挑战这一现状,但据我们所知,没有一个是完全开放的:它们的训练数据仍为专有,且/或其训练配方未公开。本文通过 OpenVision 填补了这一空白,这是一个完全开放、高性价比的视觉编码器系列,当集成到 LLaVA 等多模态框架中时,其性能可匹敌或超越 OpenAI 的 CLIP。OpenVision 建立在现有工作之上——例如,训练框架基于 CLIPS,训练数据基于 Recap-DataComp-1B——同时揭示了提升编码器质量的多个关键见解,并展示了在推进多模态模型方面的实际益处。通过发布参数规模从 5.9M 到 632.1M 不等的视觉编码器,OpenVision 为从业者在构建多模态模型时提供了容量与效率之间的灵活权衡:更大的模型提供更强的多模态性能,而较小的版本则支持轻量级、适用于边缘设备的多模态部署。

关键词

引用

@article{arxiv.2505.04601,
  title  = {OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning},
  author = {Xianhang Li and Yanqing Liu and Haoqin Tu and Hongru Zhu and Cihang Xie},
  journal= {arXiv preprint arXiv:2505.04601},
  year   = {2025}
}