InViG:基于 50 万次人机交互的交互式视觉定位基准
机器人学
2023-10-19 v1 计算机视觉与模式识别
摘要
歧义在人类交流中无处不在。以往人机交互(HRI)中的方法常依赖预定义的交互模板,导致在真实且开放场景中的性能下降。为解决这些问题,我们提出一个大规模数据集 \invig,用于语言歧义下的交互式视觉定位。我们的数据集包含超过 52 万张图像,辅以开放式的目标导向消歧对话,涵盖数百万个物体实例及相应的问答对。借助 \invig 数据集,我们开展了广泛研究并提出了一套端到端交互式视觉消歧与定位的基线方案,在验证中取得了 45.6% 的成功率。据我们所知,\invig 数据集是首个用于解决开放式交互式视觉定位的大规模数据集,为具备歧义感知的 HRI 提供了一个实用但极具挑战性的基准。代码与数据集见:\href{https://openivg.github.io}{https://openivg.github.io}。
引用
@article{arxiv.2310.12147,
title = {InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions},
author = {Hanbo Zhang and Jie Xu and Yuchen Mo and Tao Kong},
journal= {arXiv preprint arXiv:2310.12147},
year = {2023}
}
备注
8 pages, 9 figures, 3 tables, under review