中文

利用以对象为中心的先验进行3D特征蒸馏

计算机视觉与模式识别 2025-08-26 v5 机器人学

摘要

将自然语言与物理世界联系起来是一个普遍的话题,在计算机视觉和机器人学中有着广泛的应用。最近,诸如CLIP之类的2D视觉-语言模型因其在2D图像中出色的开放词汇定位能力而广受欢迎。近期工作旨在通过特征蒸馏将2D CLIP特征提升到3D,但这些工作要么学习特定于场景的神经场,从而缺乏泛化能力,要么专注于需要访问多个相机视角的室内房间扫描数据,这在机器人操作场景中不实用。此外,相关方法通常在像素级融合特征,并假设所有相机视角信息量相等。在这项工作中,我们表明这种方法会导致次优的3D特征,无论是在定位精度还是分割清晰度方面。为了解决这个问题,我们提出了一种多视角特征融合策略,该策略利用以对象为中心的先验,基于语义信息消除无信息视角,并通过实例分割掩码在对象级融合特征。为了蒸馏我们以对象为中心的3D特征,我们生成了一个大规模合成的杂乱桌面场景多视角数据集,从超过3300个独特对象实例中生成了15000个场景,并将该数据集公开。我们表明,我们的方法重建的3D CLIP特征具有更好的定位能力和空间一致性,同时仅需单视角RGB-D输入,从而摆脱了测试时对多个相机视角的依赖。最后,我们表明我们的方法可以泛化到新的桌面领域,并无需微调即可重新用于3D实例分割,并展示了其在杂乱环境中进行语言引导的机器人抓取中的实用性。

关键词

引用

@article{arxiv.2406.18742,
  title  = {3D Feature Distillation with Object-Centric Priors},
  author = {Georgios Tziafas and Yucheng Xu and Zhibin Li and Hamidreza Kasaei},
  journal= {arXiv preprint arXiv:2406.18742},
  year   = {2025}
}