中文

AWOL:使用语言进行分析而无需合成

计算机视觉与模式识别 2024-04-05 v1

摘要

存在许多经典的参数化 3D 形状模型,但使用此类模型创建新形状需要对其参数具备专业知识。例如,设想使用过程图形创建特定类型的树,或从统计形状模型创建一种新动物。我们的核心思想是利用语言来控制此类现有模型以生成新形状。这涉及学习视觉语言模型的潜在空间与 3D 模型参数空间之间的映射,我们使用一小组形状和文本对来完成此操作。我们的假设是,从语言到参数的映射允许我们为训练期间从未见过的对象生成参数。如果语言与参数之间的映射足够平滑,那么语言中的插值或泛化应该能恰当地转化为新的 3D 形状。我们使用两种截然不同的参数化形状模型(四足动物和树木)测试了我们的方法。我们使用学习到的四足动物统计形状模型,并表明我们可以使用文本生成训练期间未出现的新动物。特别是,我们展示了最先进的 3D 狗形状估计。这项工作也构成了第一种由语言驱动的 3D 树木生成方法。最后,将图像嵌入 CLIP 潜在空间使我们能够直接从图像生成动物和树木。

关键词

引用

@article{arxiv.2404.03042,
  title  = {AWOL: Analysis WithOut synthesis using Language},
  author = {Silvia Zuffi and Michael J. Black},
  journal= {arXiv preprint arXiv:2404.03042},
  year   = {2024}
}