中文

通过解耦3D场景表示从新视角预测未来视频

计算机视觉与模式识别 2024-08-05 v2

摘要

时空视频外推(VEST)使观看者能够预测3D场景的未来并从新视角观看它。最近的方法提出学习纠缠表示,旨在同时建模分层场景几何、运动预测和新视角合成,同时假设每个场景层简化了仿射运动和基于单应性的扭曲,导致不准确的视频外推。与其使用纠缠场景表示和渲染,我们的方法选择解耦场景几何与场景运动,通过将2D场景提升为3D点云,从而实现从新视角高质量渲染未来视频。为了建模未来3D场景运动,我们提出了一种解耦的两阶段方法,首先预测自我运动,然后预测动态物体(如汽车、行人)的残余运动。这种方法通过减少自我运动与动态物体运动纠缠带来的不准确预测,确保了更精确的运动预测,其中更好的自我运动预测可以显著改善视觉效果。在两个城市场景数据集上的广泛实验分析证明了所提出方法相对于强基线的优越性能。

关键词

引用

@article{arxiv.2407.21450,
  title  = {Forecasting Future Videos from Novel Views via Disentangled 3D Scene Representation},
  author = {Sudhir Yarram and Junsong Yuan},
  journal= {arXiv preprint arXiv:2407.21450},
  year   = {2024}
}

备注

Accepted to ECCV 2024. Project Page: https://skrya.github.io/projects/ffn-dsr/