ViDAR:基于单输入的视频扩散感知 4D 重建
计算机视觉与模式识别
2025-06-24 v1
摘要
动态新视角合成旨在从任意视点生成移动主体的逼真视图。这一任务在依赖单目视频时尤为具有挑战性,因为在单目条件下结构与运动的分离是病态的且监督信号稀缺。我们引入 Video Diffusion-Aware Reconstruction (ViDAR),一种新的 4D 重建框架,利用个人化扩散模型为训练高斯点阵表示生成伪多视角监督信号。通过对场景特定特征进行条件化,ViDAR 在缓解单目歧义引入的伪影的同时,恢复细粒度的外观细节。为解决基于扩散的监督在时空上的不一致性,我们提出了一种扩散感知损失函数和一种相机姿态优化策略,以将合成视图与底层场景几何对齐。在 DyCheck—a 一个具有极端视点变化的具有挑战性的基准数据集上的实验表明,ViDAR 在视觉质量和几何一致性方面均优于所有最先进的基线方法。我们进一步突出 ViDAR 在动态区域方面相较于基线方法的显著改进,并提供了一个新的基准数据集来比较在场景运动丰富区域的重建性能。项目页面:https://vidar-4d.github.io
引用
@article{arxiv.2506.18792,
title = {ViDAR: Video Diffusion-Aware 4D Reconstruction From Monocular Inputs},
author = {Michal Nazarczuk and Sibi Catley-Chandar and Thomas Tanay and Zhensong Zhang and Gregory Slabaugh and Eduardo Pérez-Pellitero},
journal= {arXiv preprint arXiv:2506.18792},
year = {2025}
}