解耦单目动态视频以实现动态视图合成
计算机视觉与模式识别
2024-08-22 v5
摘要
从单目动态视频进行动态视图合成(即给定由运动相机捕获的动态场景单目视频,为自由视点合成新视图)的挑战主要在于利用有限的 2D 帧(每帧具有变化的时间戳与视点)准确建模场景的\textbf{动态对象}。现有方法通常需要借助现成方法预处理的 2D 光流与深度图来监督网络,使其受制于预处理监督的不准确性以及将 2D 信息提升到 3D 时的歧义性。在本文中,我们以无监督方式应对该挑战。具体而言,我们将动态对象的运动解耦为对象运动与相机运动,分别由提出的无监督表面一致性与基于块的多视图约束所正则化。前者强制运动对象的 3D 几何表面随时间一致,而后者正则化其外观在不同视点间一致。此种细粒度运动表述可减轻网络的学习难度,从而使其不仅能生成更高质量的新视图,还能比需要额外监督的现有方法产生更准确的场景流与深度。
引用
@article{arxiv.2304.01716,
title = {Decoupling Dynamic Monocular Videos for Dynamic View Synthesis},
author = {Meng You and Junhui Hou},
journal= {arXiv preprint arXiv:2304.01716},
year = {2024}
}
备注
Accepted to TVCG