基于VQA并采用遗传算法优化的机器人状态识别
机器人学
2023-12-19 v1
摘要
机器人对物体与环境的状态识别已通过多种方式进行。多数情况下,这通过处理点云、利用带标注图像学习以及使用专用传感器来执行。相比之下,本研究提出一种将视觉问答(VQA)应用于从大规模数据集预训练的视觉-语言模型(PTVLM)的状态识别方法。通过使用 VQA,可以以口语直观地描述机器人状态识别。另一方面,针对同一事件可能存在多种提问方式,且状态识别性能因问题而异。因此,为提升基于 VQA 的状态识别性能,我们利用遗传算法搜索合适的提问组合。我们展示了我们的系统不仅能识别冰箱门的开/关与显示屏的开/关,还能识别透明门的开/关以及水的状态,这些以往难以识别。
引用
@article{arxiv.2303.05052,
title = {VQA-based Robotic State Recognition Optimized with Genetic Algorithm},
author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
journal= {arXiv preprint arXiv:2303.05052},
year = {2023}
}
备注
Accepted at ICRA2023