中文

DyST:面向真实世界视频的动态神经场景表示

计算机视觉与模式识别 2024-03-18 v2 人工智能 图形学 机器学习 机器人学

摘要

对世界的视觉理解超越单张图像的语义与扁平结构。在本工作中,我们旨在从单目真实世界视频中捕捉真实世界场景的三维结构与动态。我们的动态场景Transformer(DyST)模型利用神经场景表示的最新进展,将单目真实世界视频学习分解为场景内容、逐视角场景动态与相机位姿的潜表示。这一分离通过针对单目视频与我们新合成的数据集DySO的新型协同训练方案实现。DyST为动态场景学习到可触知的潜表示,能够生成对相机与场景内容分别可控的视图。

关键词

引用

@article{arxiv.2310.06020,
  title  = {DyST: Towards Dynamic Neural Scene Representations on Real-World Videos},
  author = {Maximilian Seitzer and Sjoerd van Steenkiste and Thomas Kipf and Klaus Greff and Mehdi S. M. Sajjadi},
  journal= {arXiv preprint arXiv:2310.06020},
  year   = {2024}
}

备注

ICLR 2024 spotlight. Project website: https://dyst-paper.github.io/