机器人利用预训练视觉语言模型的视觉问答进行二值状态识别
机器人学
2023-10-26 v1
摘要
识别当前状态对机器人的操作不可或缺。有待识别的状态多种多样,例如电梯门是开还是关、物体是否被正确抓取、电视是开着还是关着。迄今为止,这些状态是通过编程描述点云或原始图像的状态、标注并学习图像、使用特殊传感器等方式来识别的。与这些方法不同,我们将在大规模数据集上预训练的视觉语言模型(PTVLM)的视觉问答(VQA)应用于此类二值状态识别。该思路使我们能够以语言直观地描述状态识别而无需任何重新训练,从而以简单且通用的方式提升机器人的识别能力。我们总结了提问方法与图像处理中的多种技术,并通过实验阐明了它们的特性。
引用
@article{arxiv.2310.16405,
title = {Binary State Recognition by Robots using Visual Question Answering of Pre-Trained Vision-Language Model},
author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
journal= {arXiv preprint arXiv:2310.16405},
year = {2023}
}