中文

基于视觉语言模型和简易硬件设计的吸盘式机器人视觉辅助抓取——SuctionPrompt

机器人学 2024-11-01 v1

摘要

大语言模型与视觉语言模型 (Vision-Language Models, VLMs) 的发展,推动了机器人系统在多个领域的应用。然而,将这些模型有效集成到实际机器人任务中仍是关键挑战。我们开发了一套名为 SuctionPrompt 的通用机器人系统,运用 VLMs 的提示技术结合 3D 检测,以实现在多样化且动态环境中的产品抓取。该方法强调将 3D 空间信息与自适应动作规划相结合,以使机器人在新环境中准确接近并操纵物体。 在验证实验中,系统在选择吸取点时准确率达 75.4%,抓取常见物品的成功率达 65.0%。本研究表明,即便仅采用简单 3D 处理,VLMs 也在机器人操纵任务中展现出色的效果。

关键词

引用

@article{arxiv.2410.23640,
  title  = {SuctionPrompt: Visual-assisted Robotic Picking with a Suction Cup Using Vision-Language Models and Facile Hardware Design},
  author = {Tomohiro Motoda and Takahide Kitamura and Ryo Hanai and Yukiyasu Domae},
  journal= {arXiv preprint arXiv:2410.23640},
  year   = {2024}
}

备注

11 pages, 7 figures, 4 tables