中文

面向统一大视觉模型的跨视觉协同建模

计算机视觉与模式识别 2026-03-05 v1

摘要

最近的大型视觉模型 (LVM) 进展正从特定模态的设计转向统一的架构,以联合处理图像、视频和 3D 数据。然而,现有的统一 LVM 主要追求功能集成,忽略了跨视觉协同这一更深层次的目标:能够在视觉模态之间推理处理互补的先验知识。为此,我们提出了 PolyV,一个实现跨视觉协同的统一 LVM。从架构层面,PolyV 采用稀疏混合专家 LVM,通过动态模态路由器进行协调,使每个专家能够专注于模态特定的先验知识,同时实现跨模态的双向交互和相互细化。在训练层面,一种以协同为导向的范式结合模态特定的预训练和通过知识蒸馏和对象/关系级对齐进行粗到细的协同调优。广泛的在 10 个基准数据集上的实验,涵盖图像、视频和 3D 理解,包括需要空间或时间先验的协同关注数据集,表明 PolyV 在各项指标上一致优于现有模型,整体性能提升超过 10%。总体而言,PolyV 建立了一种统一框架,用于综合视觉推理,向真正具有协同性的 LVM 迈进。项目页面: https://sqwu.top/PolyV。

关键词

引用

@article{arxiv.2603.03564,
  title  = {Modeling Cross-vision Synergy for Unified Large Vision Model},
  author = {Shengqiong Wu and Lanhu Wu and Mingyang Bao and Wenhao Xu and Hanwang Zhang and Shuicheng Yan and Hao Fei and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2603.03564},
  year   = {2026}
}

备注

21 pages, 9 figures, 16 tables, CVPR