中文

驾驭生成式视频模型:零样态光流提取

计算机视觉与模式识别 2025-12-01 v2

摘要

从视频中提取光流仍是计算机视觉中的核心问题。受大型通用模型近期成功的启发,我们询问是否可以对仅为预测未来帧而训练的冻结自监督视频模型进行提示,而无需微调,即可输出光流。先前尝试从视频生成器中读取深度或照度需要微调;该策略不适用于光流,因为标注数据稀缺且合成数据集存在仿真到现实的鸿沟。我们受 Counterfactual World Model(CWM)范式的启发,该范式通过向下一帧预测器注入小型轨迹扰动并跟踪其传播来获取点对点对应关系,我们将这一想法扩展到生成式视频模型,以实现零样态光流提取。我们探索了几种流行的架构,发现以此方式实现零样态光流提取的成功,归功于三个模型属性:(1)对未来帧的分布式预测(避免模糊或噪声输出);(2)将每个时空块独立处理的分解潜在表示;(3)可在任意子集未来像素上进行条件的随机访问解码。这些属性在最近引入的 Local Random Access Sequence(LRAS)架构中唯一地呈现。基于 LRAS,我们提出 KL-tracing:一种新的测试时推理程序,将局部扰动注入到第一帧中,滚动模型一步,然后计算扰动与非扰动预测分布之间的 Kullback-Leibler 发散。无需任何光流特定的微调,我们的方法在真实世界的 TAP-Vid DAVIS 基准和合成 TAP-Vid Kubric 上与最先进的任务特定模型保持竞争力。我们的結果表明,对可控生成式视频模型的反事实提示是高质量光流的有效替代方案,取代监督或光度损失方法。

关键词

引用

@article{arxiv.2507.09082,
  title  = {Taming generative video models for zero-shot optical flow extraction},
  author = {Seungwoo Kim and Khai Loong Aw and Klemen Kotar and Cristobal Eyzaguirre and Wanhee Lee and Yunong Liu and Jared Watrous and Stefan Stojanov and Juan Carlos Niebles and Jiajun Wu and Daniel L. K. Yamins},
  journal= {arXiv preprint arXiv:2507.09082},
  year   = {2025}
}

备注

Project webpage: https://neuroailab.github.io/projects/kl_tracing