中文

预训练视觉-语言模型在机器人多种识别行为中的应用

机器人学 2024-03-19 v2

摘要

近年来,许多从大规模数据集中学习视觉与语言之间关系的模型被发布。这些模型执行多种任务,例如回答关于图像的问题、检索与图像最相符的句子,以及寻找图像中与短语对应的区域。尽管已有一些实例,这些预训练视觉-语言模型与机器人之间的联系仍然薄弱。如果它们被直接连接到机器人运动,会由于机器人的具身性和数据收集的困难而丧失通用性,并且无法适用于广泛的机体与情境。因此,在本研究中,我们分类并总结了在不将这些模型直接连接到机器人运动的情况下,以机器人可理解的方式灵活且简便地利用预训练视觉-语言模型的方法。我们讨论了如何在不重新训练模型的情况下将这些模型用于机器人运动选择和运动规划。我们考虑了五类提取机器人可理解信息的方法,并展示了基于这五类方法组合的状态识别、物体识别、功能可供性识别、关系识别和异常检测结果。我们期望本研究能为现有机器人的识别行为增添灵活性与易用性,以及新的应用。

关键词

引用

@article{arxiv.2303.05674,
  title  = {Robotic Applications of Pre-Trained Vision-Language Models to Various Recognition Behaviors},
  author = {Kento Kawaharazuka and Yoshiki Obinata and Naoaki Kanazawa and Kei Okada and Masayuki Inaba},
  journal= {arXiv preprint arXiv:2303.05674},
  year   = {2024}
}

备注

Accepted at Humanoids2023