中文

视频模型是否接近真正的多模态推理?

计算机视觉与模式识别 2026-04-22 v1

摘要

尽管视频模型在通用化方面取得了显著进展,但一个关键问题仍未得到严格解答:这些模型离实现真正的多模态推理有多远?现有基准测试未能严格回答此问题,因其任务设计单调且评估指标碎片化,忽略了复杂的多模态推理。为弥合这一差距,我们引入 CLVG-Bench,一个旨�通过视频生成中的情境学习探测视频模型零样本推理能力的评估框架。CLVG-Bench 包含超过 1,000 条高质量、人工标注的元数据,覆盖6大类别、47个子类别,涵盖物理模拟、逻辑推理和交互情境等复杂情景。为实现严格且可扩展的评估,我们进一步提出了适应性视频评估器(AVE),其与人类专家感知保持一致,仅需最小标注,即可在多样化的视频情境任务中提供可解释的文本反馈。广泛实验揭示了对核心问题的惊人答案:尽管顶尖视频模型(如 Seedance 2.0)在某些理解和推理子任务上表现出色,但在具备逻辑性和交互性的生成任务中表现大幌不足(成功率 <25% 和 ~0%),凸显了多模态推理和物理 grounding 作为关键瓶颈。通过系统化量化这些局限性,本方法提供了可操作的反馈意见,并为构建 truly robust、通用视频模型指明了清晰的路线图。CLVG-Bench 和代码已在此发布。

关键词

引用

@article{arxiv.2604.19193,
  title  = {How Far Are Video Models from True Multimodal Reasoning?},
  author = {Xiaotian Zhang and Jianhui Wei and Yuan Wang and Jie Tan and Yichen Li and Yan Zhang and Ziyi Chen and Daoan Zhang and Dezhi YU and Wei Xu and Songtao Jiang and Zuozhu Liu},
  journal= {arXiv preprint arXiv:2604.19193},
  year   = {2026}
}