基于预训练大规模视觉-语言模型的移动机器人日常生活巡逻语义场景差异检测
机器人学
2023-09-29 v1
摘要
对于日常生活辅助机器人而言,检测环境变化并执行任务十分重要。在计算机视觉异常检测领域,概率与深度学习方法已被用于计算图像距离。这些方法通过关注图像像素来计算距离。相比之下,本研究旨在利用当前大规模视觉-语言模型的发展来检测日常生活环境中的语义变化。利用其视觉问答(VQA)模型,我们提出一种方法,通过对参考图像和当前图像施加多个问题并以句子形式获取答案来检测语义变化。与异常检测中基于深度学习的方法不同,该方法无需任何训练或微调,不受噪声影响,且对真实世界中的语义状态变化敏感。在我们的实验中,我们通过将该方法应用于使用移动机器人 Fetch Mobile Manipulator 的真实环境巡逻任务,证明了其有效性。未来,或可通过口语为日常生活环境的变化增添解释能力。
引用
@article{arxiv.2309.16552,
title = {Semantic Scene Difference Detection in Daily Life Patroling by Mobile Robots using Pre-Trained Large-Scale Vision-Language Model},
author = {Yoshiki Obinata and Kento Kawaharazuka and Naoaki Kanazawa and Naoya Yamaguchi and Naoto Tsukamoto and Iori Yanokura and Shingo Kitagawa and Koki Shinjo and Kei Okada and Masayuki Inaba},
journal= {arXiv preprint arXiv:2309.16552},
year = {2023}
}
备注
Accepted to 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023)