HexaGen3D:StableDiffusion 距快速多样的文本到三维生成仅一步之遥
计算机视觉与模式识别
2024-01-17 v1
摘要
尽管生成建模近期取得了显著进展,但从文本提示高效生成高质量三维资产仍然是一项困难的任务。一个关键挑战在于数据稀缺:最广泛的三维数据集仅包含数百万资产,而其二维对应数据集则包含数十亿文本-图像对。为解决这一问题,我们提出了一种利用大型预训练二维扩散模型能力的新方法。具体而言,我们的方法 HexaGen3D 对预训练的文本到图像模型进行微调,使其能够联合预测 6 个正交投影和相应的潜在三平面。然后我们解码这些潜在表示以生成带纹理的网格。HexaGen3D 无需逐样本优化,并能在 7 秒内从文本提示推断出高质量且多样的物体,与现有方法相比,提供了显著更优的质量-延迟权衡。此外,HexaGen3D 对新物体或组合展现出强大的泛化能力。
引用
@article{arxiv.2401.07727,
title = {HexaGen3D: StableDiffusion is just one step away from Fast and Diverse Text-to-3D Generation},
author = {Antoine Mercier and Ramin Nakhli and Mahesh Reddy and Rajeev Yasarla and Hong Cai and Fatih Porikli and Guillaume Berger},
journal= {arXiv preprint arXiv:2401.07727},
year = {2024}
}
备注
9 pages, 8 figures, 2 tables