中文

基于VQA并采用遗传算法优化的机器人状态识别

机器人学 2023-12-19 v1

摘要

机器人对物体与环境的状态识别已通过多种方式进行。多数情况下,这通过处理点云、利用带标注图像学习以及使用专用传感器来执行。相比之下,本研究提出一种将视觉问答(VQA)应用于从大规模数据集预训练的视觉-语言模型(PTVLM)的状态识别方法。通过使用 VQA,可以以口语直观地描述机器人状态识别。另一方面,针对同一事件可能存在多种提问方式,且状态识别性能因问题而异。因此,为提升基于 VQA 的状态识别性能,我们利用遗传算法搜索合适的提问组合。我们展示了我们的系统不仅能识别冰箱门的开/关与显示屏的开/关,还能识别透明门的开/关以及水的状态,这些以往难以识别。

关键词

引用

@article{arxiv.2303.05052,
  title  = {VQA-based Robotic State Recognition Optimized with Genetic Algorithm},
  author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2303.05052},
  year   = {2023}
}

备注

Accepted at ICRA2023