中文

SV4D:基于多帧和多视角一致性的动态3D内容生成

计算机视觉与模式识别 2025-03-03 v2

摘要

我们提出了稳定视频4D(SV4D),一种用于多帧和多视角一致性动态3D内容生成的潜在视频扩散模型。与依赖为视频生成和新视角合成分别训练生成模型的先前方法不同,我们设计了一个统一的扩散模型,用于生成动态3D对象的新视角视频。具体而言,给定单目参考视频,SV4D为每个视频帧生成具有时序一致性的新视角。我们随后使用生成的新视角视频高效地优化隐式4D表示(动态NeRF),无需大多数先前方法中使用的繁琐SDS优化。为训练我们的统一新视角视频生成模型,我们从现有Objaverse数据集中构建了动态3D对象数据集。在多个数据集和用户研究中的大量实验结果表明,SV4D在新视角视频合成以及4D生成方面相较于先前方法表现处于最先进水平。

关键词

引用

@article{arxiv.2407.17470,
  title  = {SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency},
  author = {Yiming Xie and Chun-Han Yao and Vikram Voleti and Huaizu Jiang and Varun Jampani},
  journal= {arXiv preprint arXiv:2407.17470},
  year   = {2025}
}

备注

Project page: https://sv4d.github.io/