中文

OpenVision 3:面向理解与生成的统一视觉编码器家族

图像与视频处理 2026-03-16 v2 人工智能

摘要

本文提出了一族先进的视觉编码器,名为 OpenVision 3,它学习一种单一的、统一的视觉表示,可同时服务于图像理解和图像生成。我们的核心架构很简单:将 VAE 压缩的图像潜表示输入到 ViT 编码器,并训练其输出以支持两个互补角色。首先,编码器输出被传递给 ViT-VAE 解码器以重建原始图像,鼓励该表示捕获生成结构。其次,相同的表示通过对比学习和图像描述目标进行优化,增强语义特征。通过在共享的潜空间中联合优化重建驱动和语义驱动的信号,该编码器学习到的表示在两种机制下均能良好协同与泛化。我们通过在编码器冻结的情况下进行广泛的下游评估来验证这一统一设计。在生成方面,我们在 RAE 框架下对其进行了测试:我们的方法大幅超越了标准的基于 CLIP 的编码器(例如,在 ImageNet 上 gFID:1.87 vs. 2.54)。在多模态理解方面,我们将该编码器插入 LLaVA-1.5 和 LLaVA-NeXT 框架:其性能与标准的 CLIP 视觉编码器相当(例如,在 SeedBench 上为 63.3 vs. 61.2,在 GQA 上为 59.2 vs. 58.1)。我们提供了经验证据表明,生成与理解在我们的架构中是互利的,同时进一步强调了 VAE 潜空间的关键作用。我们希望这项工作能激发未来关于统一建模的研究。

关键词

引用

@article{arxiv.2601.15369,
  title  = {OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation},
  author = {Letian Zhang and Sucheng Ren and Yanqing Liu and Xianhang Li and Zeyu Wang and Yuyin Zhou and Huaxiu Yao and Zeyu Zheng and Weili Nie and Guilin Liu and Zhiding Yu and Cihang Xie},
  journal= {arXiv preprint arXiv:2601.15369},
  year   = {2026}
}