中文

SpotLight:通过交互和功能感知实现机器人场景理解

机器人学 2024-09-19 v1

摘要

尽管家庭机器人领域的研究 efforts 不断增加,但仍有许多机器人在部署于家庭环境时仍难以处理诸如抽屉或开关灯等功能性元素交互的问题,主要由于局限于特定任务的理解和交互能力。这些任务不仅需要检测和姿态估计,还需要对这些元素所提供的功能感知。为解决这些挑战并增强机器人场景理解,我们引入 SpotLight:一个针对功能元素(特别是开关灯)进行机器人交互的综合框架。该框架使机器人能够通过交互来改进环境理解。我们利用基于 VLM 的功能感知预测来估计开关灯交互的运动原语,在实际实验中实现了最高可达 84%的操作成功率。我们进一步引入包含 715 张图片的专门数据集以及用于开关灯检测的自定义检测模型。我们展示了该框架如何通过物理交互促进机器人学习,使机器人探索环境并发现场景图表示中先前未知的关系。最后,我们提出该框架的一个扩展,以适配其他功能交互,如推拉门,展示了其灵活性。视频和代码: timengelbracht.github.io/SpotLight/

关键词

引用

@article{arxiv.2409.11870,
  title  = {SpotLight: Robotic Scene Understanding through Interaction and Affordance Detection},
  author = {Tim Engelbracht and René Zurbrügg and Marc Pollefeys and Hermann Blum and Zuria Bauer},
  journal= {arXiv preprint arXiv:2409.11870},
  year   = {2024}
}

备注

timengelbracht.github.io/SpotLight/