EG4D:无需分数蒸馏的显式4D物体生成
计算机视觉与模式识别
2024-05-29 v1
摘要
近年来,设计和游戏应用中对动态3D资产的需求日益增长,催生了能够合成高质量4D物体的强大生成流程。先前的方法通常依赖分数蒸馏采样(SDS)算法来推断4D物体的不可见视角和运动,从而导致结果不理想,存在过饱和和Janus问题等缺陷。因此,受视频扩散模型最新进展的启发,我们提出通过从一张输入图像显式生成多视角视频来优化4D表示。然而,处理此类流程面临的实际挑战远非易事,包括剧烈的时间不一致性、帧间几何和纹理多样性,以及视频生成结果带来的语义缺陷。为了解决这些问题,我们提出了DG4D,一种新颖的多阶段框架,无需分数蒸馏即可生成高质量且一致的4D资产。具体来说,我们开发了协作技术和解决方案,包括用于合成时间一致的多视角视频的注意力注入策略,基于高斯泼溅的稳健且高效的动态重建方法,以及带有扩散先验的细化阶段用于语义修复。定性结果和用户偏好研究表明,我们的框架在生成质量上显著优于基线方法。代码将在\url{https://github.com/jasongzy/EG4D}发布。
引用
@article{arxiv.2405.18132,
title = {EG4D: Explicit Generation of 4D Object without Score Distillation},
author = {Qi Sun and Zhiyang Guo and Ziyu Wan and Jing Nathan Yan and Shengming Yin and Wengang Zhou and Jing Liao and Houqiang Li},
journal= {arXiv preprint arXiv:2405.18132},
year = {2024}
}