中文

LLaVA-OneVision-2:面向下一代感知智能

计算机视觉与模式识别 2026-05-26 v1

摘要

我们介绍 LLaVA-OneVision-2 (LLaVA-OV-2),目前 LLaVA-OneVision 系列中最强大的视觉语言模型, 在广泛的多模态基准测试中实现卓越性能。 模型基于原生 OneVision-Encoder 构建, incorpor 采用 Windowed Attention 实现高效局部计算, 同时保持原生分辨率。 其关键创新是 codec-stream tokenization:将压缩视频视为连续的比特成本流, 比特成本动态决定自适应时间组, 运动残差线索选取显著空间证据以形成紧凑视觉画布。 此配置将有限 token 预算集中于事件承载内容, 从而实现比固定图像组更稳定的长视频 token 压缩。 更共享的 3D RoPE 进一步将 codec 画布、抽样帧和图像置于统一的时空坐标系中。 此外,我们围绕大规模开放监督构建 LLaVA-OV-2 数据与训练堆栈:约 800 万重新标注视频样本用于预训练, 一个 400 万样本的空间语料用于微调。 我们还引入 JumpScore, 一个针对细粒度 grounding 的时序局化基准, 旨在评估高频、密集重复运动中的表征, 这是现有视频评估中欠represent 的情形。 LLaVA-OV-2 的一项突出能力是其在视频理解、时序 grounding、空间 grounding 和操作轨迹推理方面的统一感知。 在 JumpScore 上, LLaVA-OneVision-2-8B 达到 74.9 JumpScore mAP, 超越 Qwen3-VL-8B (30.1) 超过 +44.8 分; 在相同基准上, codec-stream 输入在时序 grounding 上优于帧抽样 +9.7 分。 在标准基准测试中, LLaVA-OneVision-2-8B 进一步在视频任务上超越 Qwen3-VL-8B +4.3 个平均分, 在空间任务上 +5.3 分, 在跟踪任务上 +15.6 个平均 J&F 分。

关键词

引用

@article{arxiv.2605.25979,
  title  = {LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence},
  author = {Xiang An and Yin Xie and Feilong Tang and Yunyao Yan and Huajie Tan and Didi Zhu and Changrui Chen and Xiuwei Zhao and Bin Qin and Kaicheng Yang and Yifei Shen and Yuanhan Zhang and Kaichen Zhang and Wenkang Zhang and Zheng Cheng and Nansen Zhang and Chunsheng Wu and Chunjiang Ge and Zimin Ran and Dehua Song and Chunyuan Li and Shikun Feng and Ming Hu and Zhangquan Chen and Junbo Niu and Bo Li and Ziyong Feng and Ziwei Liu and Zongyuan Ge and Jiankang Deng},
  journal= {arXiv preprint arXiv:2605.25979},
  year   = {2026}
}