中文

Semantify:利用 CLIP 简化三维可变形模型的控制

计算机视觉与模式识别 2023-08-16 v1 图形学

摘要

我们提出 Semantify:一种自监督方法,利用 CLIP 语言-视觉基础模型的语义能力来简化三维可变形模型(3D morphable models)的控制。给定参数化模型,通过随机采样模型参数、创建各种形状并渲染来创建训练数据。在 CLIP 的潜空间中计算输出图像与一组词描述符之间的相似度。我们的核心思想是:首先选择一组语义有意义且解耦的、表征该 3DMM 的描述符,然后学习从该组描述符上的得分到给定 3DMM 参数系数的非线性映射。该非线性映射通过训练一个无需人工参与的神经网络来定义。我们在众多 3DMM 上展示了结果:身体形状模型、面部形状与表情模型,以及动物形状模型。我们展示了我们的方法如何定义直观建模的简单滑块界面,并展示该映射如何用于即时将三维参数化身体形状拟合到野外部图像。

关键词

引用

@article{arxiv.2308.07415,
  title  = {Semantify: Simplifying the Control of 3D Morphable Models using CLIP},
  author = {Omer Gralnik and Guy Gafni and Ariel Shamir},
  journal= {arXiv preprint arXiv:2308.07415},
  year   = {2023}
}