中文

基于预训练视觉-语言模型图像到文本检索与黑箱优化的机器人状态识别

机器人学 2024-10-31 v1 人工智能 计算机视觉与模式识别

摘要

对环境和物体的状态识别,例如门的开/关状态和灯的亮/灭状态,对于执行日常生活支持和安全任务的机器人来说是不可或缺的。迄今为止,状态识别方法一直基于通过人工标注训练神经网络、为识别准备特殊传感器,或通过手动编程从点云或原始图像中提取特征。相比之下,我们提出了一种使用预训练视觉-语言模型的机器人状态识别方法,该模型能够执行图像到文本检索(ITR)任务。我们预先准备多种语言提示,通过ITR计算这些提示与当前图像的相似度,并执行状态识别。通过使用黑盒优化为每个提示应用最优权重,可以更高精度地进行状态识别。实验表明,该理论只需准备多个提示,无需重新训练神经网络或手动编程,即可实现多种状态识别。此外,由于每个识别器只需准备提示及其权重,无需准备多个模型,这有助于资源管理。通过语言,可以识别透明门的开/关状态、水龙头是否流水,甚至厨房是否清洁等定性状态,这些在此前一直具有挑战性。

关键词

引用

@article{arxiv.2410.22707,
  title  = {Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization},
  author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2410.22707},
  year   = {2024}
}

备注

Accepted at Humanoids2024