中文

基于几何与时间条件预测长时程未来

计算机视觉与模式识别 2024-04-18 v1

摘要

我们的工作探索了基于过去生成未来传感观测的任务。我们受到神经科学中的“预测编码”概念以及自主机器人(如自动驾驶)应用的启发。预测视频建模具有挑战性,因为未来可能是多模态的,并且在大规模上进行视频处理仍然计算昂贵。为解决这两个挑战,我们的关键洞察是利用图像扩散模型的大规模预训练,这些模型能够处理多模态性。我们将图像模型用于视频预测,通过在新帧上时间戳进行条件化。这些模型可以用静态和动态场景的视频进行训练。为允许使用modestly规模的数据集,我们通过强制模型预测(伪)深度来消除照明和纹理的不变性(深度可通过成熟的单目深度网络轻松获得)。事实上,我们表明仅仅修改网络以预测灰度像素已经可以提高视频预测的准确性。鉴于时间戳条件化带来的额外可控性,我们提出了优于传统自回归和层次采样策略的采样计划。受目标预测文献中概率指标的启发,我们在覆盖室内外场景和大量物体词汇的多样化视频集合上创建了视频预测基准。我们的实验说明了基于时间戳条件化进行预测的有效性,并显示了预测具有不变性模态的未来对于成功的重要性。

关键词

引用

@article{arxiv.2404.11554,
  title  = {Predicting Long-horizon Futures by Conditioning on Geometry and Time},
  author = {Tarasha Khurana and Deva Ramanan},
  journal= {arXiv preprint arXiv:2404.11554},
  year   = {2024}
}

备注

Project page: http://www.cs.cmu.edu/~tkhurana/depthforecasting/