一种用于文本与图像引导的4D场景生成的统一方法
计算机视觉与模式识别
2024-05-08 v3
摘要
大规模扩散生成模型正极大地简化用户提供的文本提示与图像在图像、视频和3D资产生成中的使用。然而,具有扩散引导的文本到4D动态3D场景生成这一挑战性问题在很大程度上仍未被探索。我们提出Dream-in-4D,其具有一种用于文本到4D合成的新颖两阶段方法,利用(1)3D与2D扩散引导在第一阶段有效学习高质量的静态3D资产;(2)一个可形变神经辐射场,显式地将学习到的静态资产与其形变解耦,在运动学习中保持质量;以及(3)用于形变场的多分辨率特征网格与位移全变分损失,以在第二阶段借助视频扩散引导有效学习运动。通过用户偏好研究,我们证明相较于基线方法,我们的方法在文本到4D生成的图像与运动质量、3D一致性和文本保真度上显著推进。得益于其运动解耦表示,Dream-in-4D也可轻易适配于可控生成,其中外观由一张或多张图像定义,而无需修改运动学习阶段。因此,我们的方法首次为文本到4D、图像到4D和个性化4D生成任务提供了一种统一方法。
引用
@article{arxiv.2311.16854,
title = {A Unified Approach for Text- and Image-guided 4D Scene Generation},
author = {Yufeng Zheng and Xueting Li and Koki Nagano and Sifei Liu and Karsten Kreis and Otmar Hilliges and Shalini De Mello},
journal= {arXiv preprint arXiv:2311.16854},
year = {2024}
}
备注
Project page: https://research.nvidia.com/labs/nxp/dream-in-4d/