解构视频推理
计算机视觉与模式识别
2026-05-27 v2 人工智能
摘要
最近的视频生成进展揭示了一种意想不到的现象:扩散式视频模型 exhibits non-trivial 推理能力。先前的工作将此归因于链律帧(CoF)机制,认为推理在视频帧之间顺序展开。本文我们挑战了这一假设,发现一种根本不同的机制。我们表明,视频模型中的推理主要沿扩散去噪步骤产生。通过定性分析和针对性探针实验,我们发现模型在早期去噪步骤中探索多个候选解决方案,随后逐步收敛到最终答案,这一过程我们称为链律步骤(CoS)。除了这一核心机制,我们识别了若干对模型性能至关重要的涌现推理行为:(1)工作记忆,使可持久参考成为可能;(2)自我纠正与增强,允许从错误的中间解决方案中恢复;(3)感知先于行动,早期步骤建立语义 grounding,后续步骤执行结构化操作。在扩散步骤中,我们进一步发现扩散变换器内部存在自演化的功能专化,其中早期层编码密集的感知结构,中间层执行推理,后期层巩固潜在表示。鼓励这些见解,我们提出一种简单且无需训练的策略作为概念证明,证明通过对相同模型使用不同随机种子生成的潜在轨迹进行集成,可以改善推理。总体而言,我们的工作提供了对视频生成模型中如何产生推理的系统性理解,为指导未来研究更好地利用视频模型固有的推理动力学(作为一种新型智能基质)提供了基础。
引用
@article{arxiv.2603.16870,
title = {Demystifying Video Reasoning},
author = {Ruisi Wang and Zhongang Cai and Fanyi Pu and Junxiang Xu and Wanqi Yin and Maijunxian Wang and Ran Ji and Chenyang Gu and Bo Li and Ziqi Huang and Hokin Deng and Dahua Lin and Ziwei Liu and Lei Yang},
journal= {arXiv preprint arXiv:2603.16870},
year = {2026}
}
备注
Homepage: https://www.wruisi.com/demystifying_video_reasoning