Zero3D:语义驱动的多类别三维形状生成
计算机视觉与模式识别
2023-11-15 v5 多媒体
摘要
语义驱动的三维形状生成旨在生成以文本为条件的三维物体。先前工作面临单类别生成、三维细节低频以及需要大量配对数据集训练的问题。为应对这些挑战,我们提出了一种多类别条件扩散模型。具体而言,1)为缓解大规模配对数据缺失问题,我们基于预训练的 CLIP 模型桥接文本、二维图像与三维形状;2)为获取多类别三维形状特征,我们应用条件流模型生成以 CLIP 嵌入为条件的三维形状向量;3)为生成多类别三维形状,我们采用以多类别形状向量为条件的隐层扩散模型,大幅降低了训练时间与内存消耗。
引用
@article{arxiv.2301.13591,
title = {Zero3D: Semantic-Driven Multi-Category 3D Shape Generation},
author = {Bo Han and Yitong Fu and Yixuan Shen},
journal= {arXiv preprint arXiv:2301.13591},
year = {2023}
}
备注
work in progress