三维点云中语言条件下的可供性-位姿检测
机器人学
2023-09-21 v1
摘要
可供性检测与位姿估计在许多机器人应用中极为重要。二者的结合有助于机器人获得增强的操作能力,其中生成的位姿可促进相应的可供性任务。先前用于可供性-位姿联合学习的方法受限于预定义的可供性集合,从而限制了机器人在真实环境中的适应性。本文提出一种用于三维点云中语言条件下的可供性-位姿联合学习的新方法。给定三维点云物体,我们的方法检测可供性区域,并为任意无约束的可供性标签生成合适的6-DoF位姿。我们的方法由一个开放词汇可供性检测分支和一个基于可供性文本生成6-DoF位姿的语言引导扩散模型组成。我们还引入了一个用于语言驱动的可供性-位姿联合学习任务的新高质量数据集。大量实验结果表明,我们所提方法在广泛的开放词汇可供性上有效运作,并以较大优势优于其他基线。此外,我们展示了该方法在真实机器人应用中的实用性。我们的代码与数据集公开于 https://3DAPNet.github.io
引用
@article{arxiv.2309.10911,
title = {Language-Conditioned Affordance-Pose Detection in 3D Point Clouds},
author = {Toan Nguyen and Minh Nhat Vu and Baoru Huang and Tuan Van Vo and Vy Truong and Ngan Le and Thieu Vo and Bac Le and Anh Nguyen},
journal= {arXiv preprint arXiv:2309.10911},
year = {2023}
}
备注
Project page: https://3DAPNet.github.io