中文

通过 CLIP 知识的 3D 蒸馏进行局部 3D 编辑

计算机视觉与模式识别 2023-06-23 v1

摘要

3D 内容操控是一项重要的计算机视觉任务,具有许多现实应用(如产品设计、卡通生成和 3D 虚拟形象编辑)。最近提出的 3D GAN 可利用神经辐射场(NeRF)生成多样的照片级真实 3D 感知内容。然而,NeRF 的操控仍是一个具挑战性的问题,因为操控后视觉质量往往退化,且使用如 2D 语义图等次优控制句柄进行操控。虽然文本引导的操控已在 3D 编辑中展现出潜力,但此类方法常缺乏局部性。为克服这些问题,我们提出 Local Editing NeRF(LENeRF),其仅需文本输入即可进行细粒度且局部的操控。具体地,我们给出 LENeRF 的三个附加模块:潜残差映射器、注意力场网络与形变网络,它们通过估计 3D 注意力场联合用于 3D 特征的局部操控。该 3D 注意力场以无监督方式学习,通过将 CLIP 的零样本掩码生成能力在多视角引导下蒸馏到 3D 空间。我们进行了多样的定量与定性实验及详尽评估。

关键词

引用

@article{arxiv.2306.12570,
  title  = {Local 3D Editing via 3D Distillation of CLIP Knowledge},
  author = {Junha Hyung and Sungwon Hwang and Daejin Kim and Hyunji Lee and Jaegul Choo},
  journal= {arXiv preprint arXiv:2306.12570},
  year   = {2023}
}

备注

conference: CVPR 2023