Vivid4D:通过视频填色提升单目视频4D重建效果
计算机视觉与模式识别
2025-04-21 v2
摘要
从 casually 采集的单目视频中重建4D动态场景具有重要价值,但极具挑战性,因为每个时间戳仅从单个视点观察。我们提出Vivid4D,一种新颖方法,通过增强观察视点——从单目输入合成多视点视频——来提升单目视频合成的4D效果。不同于现有方法仅依赖几何先验进行监督或使用生成先验而忽视几何的做法,我们集成了两者。这一重新定义了视角增强作为视频填色任务,观察视点基于单目深度先验被变形到新视点。为实现此目标,我们在未标注网络视频上训练视频填色模型,合成掩码模拟变形遮挡,确保缺失区域在空间和时间上一致的完成。为进一步缓解单目深度先验的不准确性,我们引入迭代视角增强策略和稳健的重建损失。实验表明,我们的方法有效改进了单目4D场景的重建与补全。项目页面:https://xdimlab.github.io/Vivid4D/。
引用
@article{arxiv.2504.11092,
title = {Vivid4D: Improving 4D Reconstruction from Monocular Video by Video Inpainting},
author = {Jiaxin Huang and Sheng Miao and BangBang Yang and Yuewen Ma and Yiyi Liao},
journal= {arXiv preprint arXiv:2504.11092},
year = {2025}
}