中文

Zero3D:语义驱动的多类别三维形状生成

计算机视觉与模式识别 2023-11-15 v5 多媒体

摘要

语义驱动的三维形状生成旨在生成以文本为条件的三维物体。先前工作面临单类别生成、三维细节低频以及需要大量配对数据集训练的问题。为应对这些挑战,我们提出了一种多类别条件扩散模型。具体而言,1)为缓解大规模配对数据缺失问题,我们基于预训练的 CLIP 模型桥接文本、二维图像与三维形状;2)为获取多类别三维形状特征,我们应用条件流模型生成以 CLIP 嵌入为条件的三维形状向量;3)为生成多类别三维形状,我们采用以多类别形状向量为条件的隐层扩散模型,大幅降低了训练时间与内存消耗。

关键词

引用

@article{arxiv.2301.13591,
  title  = {Zero3D: Semantic-Driven Multi-Category 3D Shape Generation},
  author = {Bo Han and Yitong Fu and Yixuan Shen},
  journal= {arXiv preprint arXiv:2301.13591},
  year   = {2023}
}

备注

work in progress