3D-TOGO:面向文本引导的跨类别三维物体生成
计算机视觉与模式识别
2023-08-17 v2 人工智能
摘要
文本引导的三维物体生成旨在生成由用户定义描述所描述的三维物体,这为可视化我们的想象提供了灵活途径。尽管已有一些工作致力于解决这一挑战性任务,但这些工作要么利用显式的三维表示(如网格),其缺乏纹理且需要后处理以渲染照片级真实感视图;要么需要对每个单一案例进行耗时的单独优化。在此,我们首次尝试通过新的3D-TOGO模型实现通用的文本引导跨类别三维物体生成,该模型集成了文本到视图生成模块与视图到三维生成模块。文本到视图生成模块被设计用于给定输入描述生成目标三维物体的不同视图。我们提出了先验引导、描述引导和视图对比学习,以实现更好的视图一致性与描述相似性。同时,视图到三维生成模块采用pixelNeRF模型,从先前生成的视图中获取隐式三维神经表示。我们的3D-TOGO模型以神经辐射场的形式生成具有良好纹理的三维物体,且无需针对每个描述进行耗时优化。此外,3D-TOGO可通过输入描述控制所生成三维物体的类别、颜色和形状。在最大的三维物体数据集(即ABO)上进行的大量实验表明,在PSNR、SSIM、LPIPS和CLIP-score指标上,与text-NeRF和Dreamfields相比,3D-TOGO能更好地根据输入描述在98个不同类别中生成高质量三维物体。
引用
@article{arxiv.2212.01103,
title = {3D-TOGO: Towards Text-Guided Cross-Category 3D Object Generation},
author = {Zutao Jiang and Guansong Lu and Xiaodan Liang and Jihua Zhu and Wei Zhang and Xiaojun Chang and Hang Xu},
journal= {arXiv preprint arXiv:2212.01103},
year = {2023}
}