结构解缠特征场蒸馏用于3D理解与编辑
计算机视觉与模式识别
2025-02-21 v1
摘要
最近的工作表明,能够利用或从大型预训练2D模型获得的2D特征蒸馏到3D特征,能够仅通过2D监督实现惊人的3D编辑和理解能力。尽管如此,模型假设3D特征是通过单一特征场捕获的,常常作出特征独立于视角的简化假设。在本工作中,我们提出了相反的做法,即使用多个解缠特征场来捕获3D特征涉及视角依赖和视角独立成分的不同结构组件,这些可以仅从2D特征监督中学习。随后,可以单独控制每个元素,实现语义和结构理解与编辑能力。例如,仅通过一次点击,即可对给定对象的3D特征进行分段,然后对其视角依赖(反射)属性进行分段、编辑或移除。我们在3D分割任务上评估了方法,并展示了一组新的理解与编辑任务。
引用
@article{arxiv.2502.14789,
title = {Structurally Disentangled Feature Fields Distillation for 3D Understanding and Editing},
author = {Yoel Levy and David Shavin and Itai Lang and Sagie Benaim},
journal= {arXiv preprint arXiv:2502.14789},
year = {2025}
}