AnimatableDreamer:基于规范分数蒸馏的文本引导非刚性3D模型生成与重建
计算机视觉与模式识别
2024-03-29 v3
摘要
3D生成领域的进展促进了序列3D模型生成(又称4D生成),但其在具有大运动幅度的可动画物体上的应用仍然稀缺。我们的工作提出了AnimatableDreamer,这是一个文本到4D(text-to-4D)生成框架,能够基于从单目视频中提取的骨架生成多种类别的非刚性物体。其核心在于,AnimatableDreamer配备了我们称之为规范分数蒸馏(CSD)的新型优化设计,它将2D扩散提升用于时间一致的4D生成。CSD从分数梯度的视角设计,生成在不同关节连接下具有形变鲁棒性的规范模型。值得注意的是,它还通过整合来自扩散模型的归纳先验来增强骨骼和蒙皮的真实性。此外,通过多视图蒸馏,CSD能够推断不可见区域,从而提高单目非刚性重建的保真度。大量实验证明了我们的方法具备从单目视频生成高灵活性文本引导3D模型的能力,同时相比现有的非刚性重建方法也展现出更优的重建性能。
引用
@article{arxiv.2312.03795,
title = {AnimatableDreamer: Text-Guided Non-rigid 3D Model Generation and Reconstruction with Canonical Score Distillation},
author = {Xinzhou Wang and Yikai Wang and Junliang Ye and Zhengyi Wang and Fuchun Sun and Pengkun Liu and Ling Wang and Kai Sun and Xintong Wang and Bin He},
journal= {arXiv preprint arXiv:2312.03795},
year = {2024}
}
备注
Project page: https://animatabledreamer.github.io/