中文

面向制造 3D 形状的零射线文本驱动变形:CLIPtortionist

计算机视觉与模式识别 2024-10-22 v1 图形学

摘要

我们提出了一个零射线文本驱动的 3D 形状变形系统,用于将输入 3D 网格的制造对象变形以适应输入文本描述。为此,我们的系统优化变形模型的参数,以最大化基于广泛使用的预训练视觉语言模型 CLIP 的目标函数。我们发现 CLIP 基于的目标函数存在许多不良的局部最优解;为规避这些问题,我们使用称为 BoxDefGraph 的新颖变形模型对变形进行参数化,该模型 our 系统从输入网格自动计算,BoxDefGraph 旨在捕获大多数制造对象的对齐矩形/圆形几何特征。我们然后使用 CMA-ES 全局优化算法最大化目标函数,我们发现其优于流行的基于梯度的优化器。我们展示了我们的做法产生令人满意的结果,并优于几个基线方法。

关键词

引用

@article{arxiv.2410.15199,
  title  = {CLIPtortionist: Zero-shot Text-driven Deformation for Manufactured 3D Shapes},
  author = {Xianghao Xu and Srinath Sridhar and Daniel Ritchie},
  journal= {arXiv preprint arXiv:2410.15199},
  year   = {2024}
}