中文

解耦单目动态视频以实现动态视图合成

计算机视觉与模式识别 2024-08-22 v5

摘要

从单目动态视频进行动态视图合成(即给定由运动相机捕获的动态场景单目视频,为自由视点合成新视图)的挑战主要在于利用有限的 2D 帧(每帧具有变化的时间戳与视点)准确建模场景的\textbf{动态对象}。现有方法通常需要借助现成方法预处理的 2D 光流与深度图来监督网络,使其受制于预处理监督的不准确性以及将 2D 信息提升到 3D 时的歧义性。在本文中,我们以无监督方式应对该挑战。具体而言,我们将动态对象的运动解耦为对象运动与相机运动,分别由提出的无监督表面一致性与基于块的多视图约束所正则化。前者强制运动对象的 3D 几何表面随时间一致,而后者正则化其外观在不同视点间一致。此种细粒度运动表述可减轻网络的学习难度,从而使其不仅能生成更高质量的新视图,还能比需要额外监督的现有方法产生更准确的场景流与深度。

关键词

引用

@article{arxiv.2304.01716,
  title  = {Decoupling Dynamic Monocular Videos for Dynamic View Synthesis},
  author = {Meng You and Junhui Hou},
  journal= {arXiv preprint arXiv:2304.01716},
  year   = {2024}
}

备注

Accepted to TVCG