VolumeDiffusion:基于高效体积编码器的灵活文本到 3D 生成
计算机视觉与模式识别
2024-08-14 v3
摘要
本文介绍了一种专为文本到 3D 生成设计的开创性 3D 体积编码器。为了扩大扩散模型的训练数据规模,我们开发了一种轻量级网络,以高效地从多视图图像中获取特征体积。随后,利用 3D U-Net 在扩散模型上对这些 3D 体积进行训练,以实现文本到 3D 的生成。本研究进一步解决了物体描述不准确和高维特征体积的挑战。所提出的模型在公共 Objaverse 数据集上进行训练,展示了从文本提示生成多样化且可识别样本的 promising 成果。值得注意的是,它通过文本线索实现了对物体部件特征的更精细控制,并通过在单个物体内无缝融合多个概念来促进模型的创造力。本研究通过引入一种高效、灵活且可扩展的表示方法,显著推动了 3D 生成的进展。
引用
@article{arxiv.2312.11459,
title = {VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder},
author = {Zhicong Tang and Shuyang Gu and Chunyu Wang and Ting Zhang and Jianmin Bao and Dong Chen and Baining Guo},
journal= {arXiv preprint arXiv:2312.11459},
year = {2024}
}