空间与时间上的视频外推
计算机视觉与模式识别
2022-07-27 v3 人工智能
摘要
新视角合成(NVS)与视频预测(VP)在计算机视觉中通常被视为互不相关的任务。然而,它们均可视为观测时空世界的方式:NVS 旨在从新视点合成场景,而 VP 旨在从新时间点观测场景。这两个任务为获取场景表示提供了互补信号,因为来自空间观测的视点变化揭示深度,而时间观测揭示相机与单个物体的运动。受这些观察启发,我们提出研究空间与时间上的视频外推(VEST)问题。我们提出一种模型,利用两任务的自我监督与互补线索,而现有方法只能解决其中之一。实验表明,我们的方法在室内与室外真实世界数据集上取得了优于或可与若干最先进 NVS 和 VP 方法相媲美的性能。
引用
@article{arxiv.2205.02084,
title = {Video Extrapolation in Space and Time},
author = {Yunzhi Zhang and Jiajun Wu},
journal= {arXiv preprint arXiv:2205.02084},
year = {2022}
}
备注
ECCV 2022. Project page: https://cs.stanford.edu/~yzzhang/projects/vest/