中文

视频模型提前推理:利用计划承诺解谜迷宫

计算机视觉与模式识别 2026-04-01 v1

摘要

视频扩散模型显示出诸如解谜迷宫和拼图等涌现推理能力,但关于它们在生成过程中如何推理的了解仍很少。我们首次以 2D 迷宫解谜作为受控测试台,研究视频模型的内部规划动力学。我们的调查揭示了两个发现。我们的第一个发现是早期计划承诺:视频扩散模型在前几个去噪步骤内就提交了一个高层次的运动计划,此后进一步的去噪仅改变视觉细节,而不改变 underlying trajectory。我们的第二个发现是,路径长度而非障碍密度是迷宫难度的主要预测因子,在 12 步处存在尖锐的失败阈值。这意味着视频模型只能通过链式连接多个顺序生成来推理长迷宫。为展示我们的发现的实际益处,我们引入了使用早期计划的链式技术(ChEaP),该技术仅在具有有前景早期计划的种子上进行计算,并将其链式连接以处理复杂迷宫。这将长期迷宫的准确率从 7% 提升至 67%,并在 Frozen Lake 和 VR-Bench 中的硬任务中提高 2.5 倍,适用于 Wan2.2-14B 和 HunyuanVideo-1.5。我们的分析表明,当前的视频模型比以前意识到的更深入地推理能力,这些能力可以通过更好的推理时间扩展来更可靠地引导。

关键词

引用

@article{arxiv.2603.30043,
  title  = {Video Models Reason Early: Exploiting Plan Commitment for Maze Solving},
  author = {Kaleb Newman and Tyler Zhu and Olga Russakovsky},
  journal= {arXiv preprint arXiv:2603.30043},
  year   = {2026}
}