OpenVision 2:面向多模态学习的生成式预训练视觉编码器系列
计算机视觉与模式识别
2025-09-03 v1
摘要
本文对 OpenVision 的架构与损失设计进行简化,以提升训练效率。遵循 CapPa 与 AIMv2 等先前视觉语言预训练工作,以及 LLaVA 等现代多模态设计,我们的改动相对直接:移除文本编码器(因此删除对比损失),仅保留 captioning 损失作为纯生成式训练信号。我们将其命名为新的 OpenVision 2。初始结果令人鼓舞:尽管简化后,OpenVision 2 在广泛的多模态基准测试上仍能与原模型保持竞争性能,同时显著降低训练时间与内存消耗。例如,采用 ViT-L/14 时,训练时间约减少 1.5 倍(从 83 小时降至 57 小时),内存使用约降低 1.8 倍(从 24.5GB 降至 13.8GB,等效于最大 batch size 从 2k 增至 8k)。这种卓越的训练效率也使我们能够超越 OpenVision 中使用的最大视觉编码器规模,参数规模超过 10 亿。我们坚信,这种轻量级、仅生成式的范式对未来多模态基础模型的视觉编码器开发具有吸引力。
引用
@article{arxiv.2509.01644,
title = {OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning},
author = {Yanqing Liu and Xianhang Li and Letian Zhang and Zirui Wang and Zeyu Zheng and Yuyin Zhou and Cihang Xie},
journal= {arXiv preprint arXiv:2509.01644},
year = {2025}
}