Hunyuan3D 1.0:用于文本到3D和图像到3D生成的统一框架
计算机视觉与模式识别
2025-01-24 v5 人工智能
摘要
虽然3D生成模型在显著提升了艺术家的工作流程,但现有的3D生成扩散模型存在生成速度慢和泛化性差的问题。为此,我们提出了采用两阶段方法的Hunyuan3D 1.0框架,其中包括轻量版和标准版,两者均支持文本和图像条件生成。在第一阶段,我们采用多视角扩散模型,在约4秒钟内高效生成多视角RGB图像。这些多视角图像从不同视角捕获3D资产的丰富细节,使从单视角重建任务变为多视角重建任务。在第二阶段,我们引入了一种前馈重建模型,能够在约7秒钟内快速且准确地重建3D资产。该重建网络学习了如何处理由多视角扩散引入的噪声和不一致性,并充分利用条件图像中可用信息来高效恢复3D结构。我们的框架涉及文本到图像模型,即Hunyuan-DiT,使其成为支持文本和图像条件3D生成的统一框架。我们的标准版本比轻量版和其他现有模型具有3倍的参数量。Hunyuan3D 1.0在速度与质量之间实现了惊人的平衡,显著减少了生成时间,同时保持了所 produced资产的质量和多样性。
引用
@article{arxiv.2411.02293,
title = {Hunyuan3D 1.0: A Unified Framework for Text-to-3D and Image-to-3D Generation},
author = {Xianghui Yang and Huiwen Shi and Bowen Zhang and Fan Yang and Jiacheng Wang and Hongxu Zhao and Xinhai Liu and Xinzhou Wang and Qingxiang Lin and Jiaao Yu and Lifu Wang and Jing Xu and Zebin He and Zhuo Chen and Sicong Liu and Junta Wu and Yihang Lian and Shaoxiong Yang and Yuhong Liu and Yong Yang and Di Wang and Jie Jiang and Chunchao Guo},
journal= {arXiv preprint arXiv:2411.02293},
year = {2025}
}
备注
Technical Report; 3D Generation