中文

文本到四维动态场景生成

计算机视觉与模式识别 2023-01-27 v1 人工智能 机器学习

摘要

我们提出 MAV3D(Make-A-Video3D),一种从文本描述生成三维动态场景的方法。我们的方法使用 4D 动态神经辐射场(NeRF),通过查询基于文本到视频(T2V)扩散的模型对场景外观、密度与运动一致性进行优化。由所给文本生成的动态视频可从任意相机位置与角度观看,并可合成至任意 3D 环境中。MAV3D 不需要任何 3D 或 4D 数据,且 T2V 模型仅使用文本-图像对与无标签视频进行训练。我们通过全面的定量与定性实验证明方法的有效性,并展示相较先前已建立的内部基线的改进。据我们所知,我们的方法是首个根据文本描述生成 3D 动态场景的方法。

关键词

引用

@article{arxiv.2301.11280,
  title  = {Text-To-4D Dynamic Scene Generation},
  author = {Uriel Singer and Shelly Sheynin and Adam Polyak and Oron Ashual and Iurii Makarov and Filippos Kokkinos and Naman Goyal and Andrea Vedaldi and Devi Parikh and Justin Johnson and Yaniv Taigman},
  journal= {arXiv preprint arXiv:2301.11280},
  year   = {2023}
}