Video-Zero:自演化视频理解
计算机视觉与模式识别
2026-05-15 v1
摘要
自演化为改进推理模型提供了一条有前景的途径,而无需依赖密集的人工标注。然而,将这一范式扩展到视频理解仍处于探索不足且具挑战性的阶段:视频冗长、动态且高度冗余,而推理所需的证据通常是稀疏且时间局部化的。直接从完整视频中生成困难问答对,因此可能产生看似困难但基础薄弱的监督,依赖于静态线索或语言先验而非时间证据。在本工作中,我们认为视频自演化的关键瓶颈不仅在于难度,更在于定位。我们提出 Video-Zero,一个无需标注的 Questioner-Solver 协同演化框架,将自演化以时间局部化的证据为中心。Questioner 发现有信息量的证据片段并生成基于证据的问题,而 Solver 学习回答问题并将其预测与支持证据对齐。这形成了一个由证据发现、基于证据的监督和证据对齐学习构成的迭代闭环。在跨越时间定位、长视频理解和视频推理的 13 个基准测试中,Video-Zero 持续改进了多个视频 VLM 主干,证明了以证据为中心的自演化的有效性与可迁移性。
引用
@article{arxiv.2605.14733,
title = {Video-Zero: Self-Evolution Video Understanding},
author = {Ruixu Zhang and Deyi Ji and Lanyun Zhu and Xuanyi Liu and Yuxin Meng and Ruihang Chu and Yujiu Yang},
journal= {arXiv preprint arXiv:2605.14733},
year = {2026}
}