DreamStone:以图像为阶梯的文本引导3D形状生成
计算机视觉与模式识别
2023-09-27 v3
摘要
本文提出一种新的文本引导3D形状生成方法DreamStone,该方法以图像作为阶梯来弥合文本与形状模态之间的差距,从而在无需配对文本与3D数据的情况下生成3D形状。我们方法的核心是一种两阶段特征空间对齐策略,利用预训练的单视图重建(SVR)模型将CLIP特征映射到形状:首先将CLIP图像特征映射到SVR模型细节丰富的3D形状空间,然后通过鼓励渲染图像与输入文本之间的CLIP一致性,将CLIP文本特征映射到3D形状空间。此外,为超越SVR模型的生成能力,我们设计了一个文本引导的3D形状风格化模块,可用新颖的结构与纹理增强输出形状。进一步,我们利用预训练的文本到图像扩散模型来增强生成的多样性、保真度与风格化能力。我们的方法通用、灵活且可扩展,可轻松与各种SVR模型集成以扩展生成空间并提升生成保真度。大量实验结果表明,我们的方法在生成质量及与输入文本的一致性方面优于SOTA方法。代码与模型发布于https://github.com/liuzhengzhe/DreamStone-ISS。
引用
@article{arxiv.2303.15181,
title = {DreamStone: Image as Stepping Stone for Text-Guided 3D Shape Generation},
author = {Zhengzhe Liu and Peng Dai and Ruihui Li and Xiaojuan Qi and Chi-Wing Fu},
journal= {arXiv preprint arXiv:2303.15181},
year = {2023}
}
备注
IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)