中文

CLIP-Forge:面向零样本文本到形状生成

计算机视觉与模式识别 2022-05-02 v2 人工智能

摘要

使用自然语言生成形状能够开启想象和创造周围事物的新方式。尽管文本到图像生成近期取得了显著进展,但由于缺乏大规模配对的文本与形状数据,文本到形状生成仍是一个具有挑战性的问题。我们提出了一种简单而有效的零样本文本到形状生成方法,规避了此类数据稀缺问题。我们提出的方法名为 CLIP-Forge,基于两阶段训练过程,仅依赖于未标注的形状数据集和预训练的图像-文本网络(如 CLIP)。我们的方法具有避免昂贵的推理时优化以及能够为给定文本生成多个形状的优势。我们不仅从定性和定量上展示了 CLIP-Forge 模型有前景的零样本泛化能力,还提供了广泛的对比评估以更好地理解其行为。

关键词

引用

@article{arxiv.2110.02624,
  title  = {CLIP-Forge: Towards Zero-Shot Text-to-Shape Generation},
  author = {Aditya Sanghi and Hang Chu and Joseph G. Lambourne and Ye Wang and Chin-Yi Cheng and Marco Fumero and Kamal Rahimi Malekshan},
  journal= {arXiv preprint arXiv:2110.02624},
  year   = {2022}
}

备注

Accepted by CVPR 2022