借助视频进行推理:视频生成作为有前景的多模态推理范式
计算机视觉与模式识别
2026-04-08 v2 计算与语言
摘要
“以文本进行推理”和“以图像进行推理”范式显著提升了大型语言模型 (LLM) 和视觉语言模型 (VLM) 的推理能力。然而,这些范式存在固有的局限性:(1) 图像仅捕获单个时刻,无法代表动态过程或连续变化;(2) 文本与视觉作为独立模态的分离,阻碍了统一的多模态理解与生成。因此,我们提出“以视频进行推理”这一新范式,利用诸如 Sora-2 之类的视频生成模型将视频帧作为统一的多模态推理介质。为支持这一探索,我们开发了 Video Thinking Benchmark (VideoThinkBench),涵盖面向视觉的任务(如 eyeballing puzzles)和面向文本的任务(如 GSM8K 和 MMMU)。我们在 VideoThinkBench 上的评估表明,Sora-2 具备相当的推理能力。在视觉任务方面,Sora-2 与最先进的 VLM 水平持平,并在 eyeballing puzzles 上超越 GPT-5 10%;在文本任务方面,Sora-2 在 MATH 上达到 92% 的准确率,在 MMMU 上达到 69.2% 的准确率。我们系统性地分析了这些能力的来源。我们还发现自洽性和情境学习可提升 Sora-2 的性能。总之,我们的发现表明,视频生成模型是潜在的统一多模态理解与生成模型,使“以视频进行推理”成为潜在的统一多模态推理范式。
引用
@article{arxiv.2511.04570,
title = {Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm},
author = {Jingqi Tong and Yurong Mou and Hangcheng Li and Mingzhe Li and Yongzhuo Yang and Ming Zhang and Qiguang Chen and Tianyi Liang and Xiaomeng Hu and Yining Zheng and Xinchi Chen and Jun Zhao and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2511.04570},
year = {2026}
}
备注
34 pages, 17 figures