中文

Bi-VLA:面向双臂机器人灵巧操作的视觉-语言-动作模型系统

机器人学 2024-08-20 v2

摘要

本研究提出了Bi-VLA(视觉-语言-动作)模型,这是一种专为双臂机器人灵巧操作设计的新型系统,它无缝集成了用于场景理解的视觉、用于将人类指令翻译为可执行代码的语言理解以及物理动作生成。我们通过一系列家务任务评估了该系统的功能,包括根据人类指令准备所需的沙拉。Bi-VLA展示了其解释复杂人类指令、感知和理解食材视觉上下文以及执行精确双臂动作以准备所需沙拉的能力。我们通过一系列实验,从准确性、效率以及对不同沙拉食谱和人类偏好的适应性方面评估了系统性能。结果显示,语言模块生成正确可执行代码的成功率为100%,视觉模块检测特定食材的成功率为96.06%,正确执行用户请求任务的总体成功率为83.4%。

关键词

引用

@article{arxiv.2405.06039,
  title  = {Bi-VLA: Vision-Language-Action Model-Based System for Bimanual Robotic Dexterous Manipulations},
  author = {Koffivi Fidèle Gbagbe and Miguel Altamirano Cabrera and Ali Alabbas and Oussama Alyunes and Artem Lykov and Dzmitry Tsetserukou},
  journal= {arXiv preprint arXiv:2405.06039},
  year   = {2024}
}

备注

The paper was accepted to the IEEE SMC 2024