通过视觉语言模型增强机器人解释能力:基于视觉输入解释以改善人机交互的初步研究
机器人学
2024-04-16 v1
摘要
本文介绍了在我们先前工作基础上改进的系统,旨在为自主机器人在人机交互(HRI)过程中的行为生成解释。此前,我们开发了一个使用大语言模型(LLM)解释日志并生成自然语言解释的系统。在本研究中,我们通过引入视觉语言模型(VLM)扩展了该方法,使系统能够结合视觉输入的上下文来分析文本日志。该方法允许生成结合机器人日志数据与其捕获图像的解释。我们在一个基本的导航任务上测试了该增强系统,其中机器人需要避开人类障碍物。这项初步研究的结果表明,增加视觉解释通过精确识别障碍物并提高所提供解释的准确性,改善了系统的解释能力。
引用
@article{arxiv.2404.09705,
title = {Enhancing Robot Explanation Capabilities through Vision-Language Models: a Preliminary Study by Interpreting Visual Inputs for Improved Human-Robot Interaction},
author = {David Sobrín-Hidalgo and Miguel Ángel González-Santamarta and Ángel Manuel Guerrero-Higueras and Francisco Javier Rodríguez-Lera and Vicente Matellán-Olivera},
journal= {arXiv preprint arXiv:2404.09705},
year = {2024}
}
备注
5 pages, 4 figures. This paper is a preprint of an article submitted to the Robot Trust for Symbiotic Societies (RTSS) workshop (ICRA 2024)