中文

基于视觉语言模型的机器人液体感知物理推理

机器人学 2024-04-11 v1

摘要

由于大型语言模型(LLM)卓越的推理能力和从海量训练语料中学到的广泛知识,将其应用于机器人任务的兴趣日益浓厚。将 LLM 扎根于物理世界仍然是一个开放性挑战,因为它们只能处理文本输入。大型视觉语言模型(LVLM)的最新进展通过引入视觉输入实现了对物理世界更全面的理解,提供了比单一语言更丰富的上下文信息。在本工作中,我们提出了一种新范式,利用 OpenAI 最先进的 LVLM GPT-4V(ision),使具身智能体能够通过基于图像的环境反馈来感知液体对象。具体而言,我们利用 GPT-4V 的物理理解能力来解释非视觉反馈(如力/力矩传感器数据)的视觉表示(如时间序列图),从而以图像为代理,间接实现超越视觉和语言的多模态感知。我们使用 10 种常见家用液体和各种几何形状及材料的容器评估了我们的方法。在无需任何训练或微调的情况下,我们证明了我们的方法能够使机器人间接感知液体的物理响应并估计其粘度。我们还表明,通过对交互中学习到的视觉和物理属性进行联合推理,我们的方法能够在缺乏强视觉线索(如带有清晰文本或符号的容器标签)的情况下识别液体对象,将准确率从表现最佳的纯视觉变体所达到的 69.0% 提升至 86.0%。

关键词

引用

@article{arxiv.2404.06904,
  title  = {Vision-Language Model-based Physical Reasoning for Robot Liquid Perception},
  author = {Wenqiang Lai and Yuan Gao and Tin Lun Lam},
  journal= {arXiv preprint arXiv:2404.06904},
  year   = {2024}
}

备注

8 pages, 6 figures, submitted to IROS 2024