中文

D$^3$Fields:用于零样本可泛化重排任务的动态3D描述子场

机器人学 2024-10-18 v3 计算机视觉与模式识别 机器学习

摘要

场景表示是机器人操控系统中的关键设计选择。理想的表示应具备3D、动态和语义特性,以满足多样化操控任务的需求。然而,以往工作往往无法同时具备这三种属性。在本工作中,我们引入D3^3Fields——动态3D描述子场。这些场是隐式3D表示,接收3D点并输出语义特征与实例掩码。它们还能捕捉底层3D环境的动态。具体而言,我们将工作空间中的任意3D点投影到多视角2D视觉观测上,并插值来自视觉基础模型的特征。所得到的融合描述子场允许使用具有不同上下文、风格和实例的2D图像进行灵活的目标指定。为评估这些描述子场的有效性,我们以零样本方式将我们的表示应用于重排任务。通过在真实世界与仿真中的广泛评估,我们证明了D3^3Fields对零样本可泛化重排任务是有效的。我们还将其与最先进的隐式3D表示进行比较,显示出在有效性与效率上的显著提升。

关键词

引用

@article{arxiv.2309.16118,
  title  = {D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement},
  author = {Yixuan Wang and Mingtong Zhang and Zhuoran Li and Tarik Kelestemur and Katherine Driggs-Campbell and Jiajun Wu and Li Fei-Fei and Yunzhu Li},
  journal= {arXiv preprint arXiv:2309.16118},
  year   = {2024}
}

备注

Accepted to Conference on Robot Learning (CoRL 2024) as Oral Presentation. The first three authors contributed equally. Project Page: https://robopil.github.io/d3fields/