Spot-Compose:面向点云中开放词汇物体检索与抽屉操作的框架
机器人学
2024-04-22 v1 计算机视觉与模式识别
摘要
近年来,深度学习与现代大规模数据集技术在 3D 实例分割、抓取位姿估计和机器人学方面取得了令人瞩目的进展。这使得直接在 3D 场景中进行精确检测、具备物体与环境感知的抓取预测,以及鲁棒且可重复的机器人操作成为可能。本研究旨在将这些近期方法整合为一个综合框架,以用于以人为中心环境中的机器人交互与操作。具体而言,我们利用从商用 3D 扫描仪获取的 3D 重建进行开放词汇实例分割,并结合抓取位姿估计,以展示动态拾取物体和打开抽屉的能力。我们在两组真实世界实验(包括动态物体检索和打开抽屉)中展示了模型的性能和鲁棒性,分别报告了 51% 和 82% 的成功率。我们的框架代码及视频可在以下网址获取:https://spot-compose.github.io/。
引用
@article{arxiv.2404.12440,
title = {Spot-Compose: A Framework for Open-Vocabulary Object Retrieval and Drawer Manipulation in Point Clouds},
author = {Oliver Lemke and Zuria Bauer and René Zurbrügg and Marc Pollefeys and Francis Engelmann and Hermann Blum},
journal= {arXiv preprint arXiv:2404.12440},
year = {2024}
}
备注
Accepted at ICRA 2024 Workshops. Code and videos available at https://spot-compose.github.io/