中文

Vidi2.5:用于视频理解和生成的大型多模态模型

计算机视觉与模式识别 2026-01-21 v2

摘要

视频已成为互联网上沟通和创意的主要媒介,推动了对可扩展高质量视频制作的强大需求。Vidi 模型正向下一代视频创建不断演进,并在多模态时间检索(TR)方面实现了最先进的性能。在其第二个版本中,Vidi2 采用细粒度时空定位(STG)进行视频理解,并扩展其视频问答(Video QA)能力,实现全面多模态推理。给定文本查询,Vidi2 不仅能识别相应的时间戳,还能在输出时间范围内识别目标对象的边界框。为全面评估 STG,我们引入新的基准 VUE-STG,相较于现有 STG 数据集实现了关键性改进。此外,我们将之前的 VUE-TR基准升级为 VUE-TR-V2,实现更均衡的时长和查询分布。值得注意的是,Vidi2 模型在 VUE-TR-V2 和 VUE-STG 上显著优于领先的专有系统,如 Gemini 3 Pro Preview 和 GPT-5,同时在视频 QA 基准上与规模相似的流行开源模型实现了具竞争力的结果。最新的 Vidi2.5 在 STG 能力和略微提升的 TR 和 Video QA 性能方面均优于 Vidi2。该更新还引入了 Vidi2.5-Think 模型,用于处理复杂情节推理。为全面评估情节理解性能,我们提出 VUE-PLOT 基准,包含两个轨道:角色和推理。值得注意的是,Vidi2.5-Think 在细粒度角色理解方面超越了 Gemini 3 Pro Preview,在复杂情节推理方面实现了相当水平的性能。此外,我们展示了 Vidi2.5 在一个具有挑战性的真实世界应用——视频编辑规划中的有效性。

关键词

引用

@article{arxiv.2511.19529,
  title  = {Vidi2.5: Large Multimodal Models for Video Understanding and Creation},
  author = {Vidi Team and Chia-Wen Kuo and Chuang Huang and Dawei Du and Fan Chen and Fanding Lei and Feng Gao and Guang Chen and Haoji Zhang and Haojun Zhao and Jin Liu and Jingjing Zhuge and Lili Fang and Lingxi Zhang and Longyin Wen and Lu Guo and Lu Xu and Lusha Li and Qihang Fan and Rachel Deng and Shaobo Fang and Shu Zhang and Sijie Zhu and Stuart Siew and Weiyan Tao and Wen Zhong and Xiaohui Shen and Xin Gu and Ye Yuan and Yicheng He and Yiming Cui and Zhenfang Chen and Zhihua Wu and Zuhua Lin},
  journal= {arXiv preprint arXiv:2511.19529},
  year   = {2026}
}