中文

面向开放世界中统一交互式视觉定位

机器人学 2024-02-20 v2

摘要

在人机交互(HRI)中,由于自然语言不可避免的歧义性,交互式视觉定位既具挑战性又很实用。它要求机器人通过主动信息收集来消除用户输入的歧义。以往的方法通常依赖预定义模板来提出消歧问题,导致在真实交互场景中性能下降。在本文中,我们提出了 TiO,一个用于人机交互中交互式视觉定位的端到端系统。得益于视觉对话和定位的统一表述,我们的方法可以在大量公共数据的联合上进行训练,并对多样化且具有挑战性的开放世界场景表现出卓越的泛化能力。在实验中,我们在 GuessWhat?! 和 InViG 基准上验证了 TiO,以明显优势刷新了最先进的性能。此外,我们在精心挑选的 150 个具有挑战性的场景以及真实机器人平台上进行了 HRI 实验。结果表明,我们的方法对多样化的视觉和语言输入表现出卓越的泛化能力,并具有高成功率。代码和演示可在 https://github.com/jxu124/TiO 获取。

关键词

引用

@article{arxiv.2401.16699,
  title  = {Towards Unified Interactive Visual Grounding in The Wild},
  author = {Jie Xu and Hanbo Zhang and Qingyi Si and Yifeng Li and Xuguang Lan and Tao Kong},
  journal= {arXiv preprint arXiv:2401.16699},
  year   = {2024}
}

备注

Accepted to ICRA 2024