中文

基于视觉-语言模型的接近传感反射率估计:利用分布式语义实现机器人底层认知

机器人学 2024-08-09 v3

摘要

大型语言模型(LLMs)和视觉-语言模型(VLMs)在机器人领域的高层认知中应用日益广泛,但它们在底层认知(如解读传感器信息)中的应用仍处于探索不足的状态。在机器人抓取中,估计物体的反射率对于成功抓取至关重要,因为它会显著影响接近传感器测量的距离。我们研究了LLMs是否能够仅从物体名称估计反射率,利用分布式语义中嵌入的人类知识,以及VLMs中语言的潜在结构是否对基于图像的反射率估计产生积极影响。在本文中,我们验证了:1)GPT-3.5和GPT-4等LLMs可以仅使用文本作为输入来估计物体的反射率;2)CLIP等VLMs可以提高其从图像进行反射率估计的泛化能力。我们的实验表明,GPT-4仅使用文本输入估计物体反射率的平均误差为14.7%,低于仅使用图像的ResNet。此外,CLIP取得了11.8%的最低平均误差,而GPT-3.5获得了19.9%的误差,与ResNet的17.8%相比具有竞争力。这些结果表明,LLMs和VLMs中的分布语义增强了它们的泛化能力,并且VLMs所获得的知识受益于语言的潜在结构。

关键词

引用

@article{arxiv.2404.07717,
  title  = {Reflectance Estimation for Proximity Sensing by Vision-Language Models: Utilizing Distributional Semantics for Low-Level Cognition in Robotics},
  author = {Masashi Osada and Gustavo A. Garcia Ricardez and Yosuke Suzuki and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2404.07717},
  year   = {2024}
}

备注

24 pages, 13 figures, submitted to Advanced Robotics Special Issue on Real-World Robot Applications of the Foundation Models