中文

CognitiveDog: 基于大型多模态模型的四足机器人视觉与语言到动作的翻译系统

机器人学 2024-01-18 v1

摘要

本文介绍了CognitiveDog,这是一种基于大型多模态模型的四足机器人开创性开发,它不仅能够与人类进行语言交流,还能通过物体操作与环境进行物理交互。该系统在配备定制夹爪的Unitree Go1机器狗上实现,展示了自主决策能力,能够独立确定最合适的动作以及与各种物体的交互,以完成用户定义的任务。这些任务不一定包含直接指令,挑战机器人基于自然语言输入和环境线索来理解和执行任务。本文深入探讨了该系统的复杂性、数据集特征以及软件架构。该开发的关键在于机器人利用视觉SLAM进行空间导航、有效操作和运输物体,以及在任务执行过程中提供有洞察力的自然语言评论的能力。实验结果突出了机器人高级的任务理解能力和适应性,展示了其在现实世界应用中的潜力。用于微调机器狗行为生成模型的数据集可在以下链接获取:huggingface.co/datasets/ArtemLykov/CognitiveDog_dataset。

关键词

引用

@article{arxiv.2401.09388,
  title  = {CognitiveDog: Large Multimodal Model Based System to Translate Vision and Language into Action of Quadruped Robot},
  author = {Artem Lykov and Mikhail Litvinov and Mikhail Konenkov and Rinat Prochii and Nikita Burtsev and Ali Alridha Abdulkarim and Artem Bazhenov and Vladimir Berman and Dzmitry Tsetserukou},
  journal= {arXiv preprint arXiv:2401.09388},
  year   = {2024}
}

备注

This paper has been accepted for publication at the HRI2024 conference