Consistent4D:从单目视频生成一致的 360° 动态物体
计算机视觉与模式识别
2023-11-07 v1
摘要
本文提出 Consistent4D,一种从非标定单目视频生成 4D 动态物体的新方法。独特地,我们将 360 度动态物体重建视为 4D 生成问题,从而免去繁琐的多视角数据采集与相机标定。这是通过利用物体级 3D 感知图像扩散模型作为训练动态神经辐射场(DyNeRF)的主要监督信号实现的。具体而言,我们提出级联 DyNeRF(Cascade DyNeRF),以在沿时间轴离散的监督信号下促进稳定收敛与时间连续性。为实现空间与时间一致性,我们进一步引入插值驱动一致性损失(Interpolation-driven Consistency Loss),通过最小化 DyNeRF 渲染帧与预训练视频插值模型插值帧之间的差异进行优化。大量实验表明,我们的 Consistent4D 可竞争力媲美先前替代方案,为从单目视频进行 4D 动态物体生成开辟新可能,同时也在常规文本到 3D 生成任务中展现优势。项目页为 https://consistent4d.github.io/。
引用
@article{arxiv.2311.02848,
title = {Consistent4D: Consistent 360{\deg} Dynamic Object Generation from Monocular Video},
author = {Yanqin Jiang and Li Zhang and Jin Gao and Weimin Hu and Yao Yao},
journal= {arXiv preprint arXiv:2311.02848},
year = {2023}
}
备注
Technique report. Project page: https://consistent4d.github.io/