中文

Michelangelo:基于形状-图像-文本对齐隐空间表征的条件式三维形状生成

计算机视觉与模式识别 2023-07-04 v2

摘要

我们提出了一种新颖的“先对齐后生成”方法来应对基于二维图像或文本生成通用三维形状这一具有挑战性的任务。直接从图像或文本学习条件生成模型到三维形状容易产生与条件不一致的结果,因为三维形状多出一个维度,其分布与二维图像和文本显著不同。为弥合三种模态之间的领域鸿沟并促进多模态条件三维形状生成,我们探索在形状-图像-文本对齐空间中表示三维形状。我们的框架包含两个模型:形状-图像-文本对齐变分自编码器(SITA-VAE)和条件对齐形状隐扩散模型(ASLDM)。前者将三维形状编码到与图像和文本对齐的形状隐空间,并通过基于 transformer 的解码器重建对应于给定形状嵌入的细粒度三维神经场。后者学习从图像或文本空间到隐形状空间的概率映射函数。我们的大量实验表明,我们提出的方法能生成更高质量、更多样化且语义上更好地符合视觉或文本条件输入的三维形状,验证了形状-图像-文本对齐空间用于跨模态三维形状生成的有效性。

关键词

引用

@article{arxiv.2306.17115,
  title  = {Michelangelo: Conditional 3D Shape Generation based on Shape-Image-Text Aligned Latent Representation},
  author = {Zibo Zhao and Wen Liu and Xin Chen and Xianfang Zeng and Rui Wang and Pei Cheng and Bin Fu and Tao Chen and Gang Yu and Shenghua Gao},
  journal= {arXiv preprint arXiv:2306.17115},
  year   = {2023}
}

备注

Project Website: https://neuralcarver.github.io/michelangelo