通过 CLIP 知识的 3D 蒸馏进行局部 3D 编辑
计算机视觉与模式识别
2023-06-23 v1
摘要
3D 内容操控是一项重要的计算机视觉任务,具有许多现实应用(如产品设计、卡通生成和 3D 虚拟形象编辑)。最近提出的 3D GAN 可利用神经辐射场(NeRF)生成多样的照片级真实 3D 感知内容。然而,NeRF 的操控仍是一个具挑战性的问题,因为操控后视觉质量往往退化,且使用如 2D 语义图等次优控制句柄进行操控。虽然文本引导的操控已在 3D 编辑中展现出潜力,但此类方法常缺乏局部性。为克服这些问题,我们提出 Local Editing NeRF(LENeRF),其仅需文本输入即可进行细粒度且局部的操控。具体地,我们给出 LENeRF 的三个附加模块:潜残差映射器、注意力场网络与形变网络,它们通过估计 3D 注意力场联合用于 3D 特征的局部操控。该 3D 注意力场以无监督方式学习,通过将 CLIP 的零样本掩码生成能力在多视角引导下蒸馏到 3D 空间。我们进行了多样的定量与定性实验及详尽评估。
引用
@article{arxiv.2306.12570,
title = {Local 3D Editing via 3D Distillation of CLIP Knowledge},
author = {Junha Hyung and Sungwon Hwang and Daejin Kim and Hyunji Lee and Jaegul Choo},
journal= {arXiv preprint arXiv:2306.12570},
year = {2023}
}
备注
conference: CVPR 2023