中文

基于预训练视觉语言模型和黑盒优化的机器人环境状态识别

机器人学 2024-09-27 v1 人工智能 计算机视觉与模式识别

摘要

为了使机器人能够在多样化的环境中自主导航和操作,识别其环境状态是必不可少的。另一方面,环境状态识别传统上涉及针对每种要识别的状态而设计的独特方法。在本研究中,我们通过预训练的大规模视觉语言模型对机器人进行统一的环境状态识别,使用语言进行交互。我们应用了视觉问答和图像到文本检索,这些是视觉语言模型的任务。我们展示,通过我们的方法,可以不训练神经网络或手动编程的情况下识别不仅是否打开/关闭房间门,还能识别透明门是否打开/关闭,以及水龙头是否有水流。此外,通过根据黑盒优化从准备好的文本集合中选择合适的文本,可以提高识别准确率。对于每种状态识别,只需更改文本集合及其权重,无需准备多个不同的模型和程序,便于源代码和计算机资源的管理。我们实验性地演示了该方法的有效性,并将其应用于移动机器人 Fetch 上的识别行为。

关键词

引用

@article{arxiv.2409.17519,
  title  = {Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization},
  author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2409.17519},
  year   = {2024}
}

备注

Accepted at Advanced Robotics, website - https://haraduka.github.io/vlm-bbo/