人类-机器人交互中的具身指代理解
机器人学
2025-12-09 v1
摘要
随着机器人进入人类工作空间,他们需要理解具身的人类指令,以实现直观而流畅的人类-机器人交互(HRI)。然而,由于缺乏捕获多样化 HRI 场景中自然具身互动的大规模数据集,准确理解仍具挑战性。现有数据集受视角偏好、单视图收集、非语言手势覆盖不足以及主要聚焦室内环境的限制。为此,我们提出 Refer360 数据集,包含跨越多样视角、覆盖室内外环境的大规模具身语言与非语言互动数据。此外,我们引入 MuRes,一种多模态引导残差模块,用于提升具身指代理解能力。MuRes 作为信息瓶颈,提取特定模态的显著信号并注入预训练表示,形成下游任务的互补特征。我们在包括 Refer360 在内的四个 HRI 数据集上进行大规模实验,结果表明当前多模态模型未能全面捕获具身互动;但通过 MuRes 增强后在性能上 consistently 提升。这些发现将 Refer360 确立为宝贵的基准,并展示了引导残差学习在人类环境中运行的机器人具身指代理解方面的潜力。
引用
@article{arxiv.2512.06558,
title = {Embodied Referring Expression Comprehension in Human-Robot Interaction},
author = {Md Mofijul Islam and Alexi Gladstone and Sujan Sarker and Ganesh Nanduru and Md Fahim and Keyan Du and Aman Chadha and Tariq Iqbal},
journal= {arXiv preprint arXiv:2512.06558},
year = {2025}
}
备注
14 pages, 7 figures, accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026