中文

SInViG: 一种用于人机交互的自进化交互式视觉智能体

机器人学 2024-02-21 v2

摘要

语言歧义在我们的日常生活中普遍存在。以往的工作采用机器人与人类之间的交互来进行语言消歧。然而,当交互式机器人部署在日常环境中时,由于复杂且不可预测的视觉输入、开放式交互以及多样化的用户需求,自然的人机交互面临重大挑战。在本文中,我们提出了SInViG,这是一种基于自然语言的人机交互自进化交互式视觉智能体,旨在通过多轮视觉语言对话解决语言歧义(如果有的话)。它持续自动地从无标签图像和大语言模型中学习,无需人工干预,从而对视觉和语言复杂性更具鲁棒性。得益于自进化,它在多个交互式视觉定位基准上达到了新的最先进水平。此外,我们的人机交互实验表明,进化后的模型持续获得人类用户越来越多的偏好。此外,我们还将我们的模型部署在Franka机器人上,用于交互式操作任务。结果表明,尽管环境复杂且存在干扰,我们的模型仍能遵循多样化的用户指令,并以自然语言与人类自然交互。

关键词

引用

@article{arxiv.2402.11792,
  title  = {SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction},
  author = {Jie Xu and Hanbo Zhang and Xinghang Li and Huaping Liu and Xuguang Lan and Tao Kong},
  journal= {arXiv preprint arXiv:2402.11792},
  year   = {2024}
}