中文

面向模糊离视图指令的多模态外指代解析:基于交互式提问

机器人学 2025-08-25 v1 人工智能

摘要

日常生活支持机器人必须解释涉及指示代词(如“请把那杯水给我”)的模糊语言指令,即使目标物体或用户不在机器人视野中。现有方法主要依赖视觉数据,难以应用于目标物体或用户不可见的实际场景。我们提出一种基于声源定位(SSL)、语义映射、视觉语言模型(VLMs)和与GPT-4o交互式提问的多模态外指代解析框架(MIEL)。该方法首先构建环境语义地图,通过用户骨骼数据估计 linguistic 查询的候选物体。利用SSL使机器人指向最初不在其视野内的用户,实现对用户手势和指向方向的精准识别。当剩余歧义时,机器人主动与用户交互,并利用GPT-4o制定澄清问题。实验表明,在实际环境中,相较于不使用SSL和交互式提问的方法,用户可见时性能提升约1.3倍,用户不可见时提升约2.0倍。项目网站为 https://emergentsystemlabstudent.github.io/MIEL/。

关键词

引用

@article{arxiv.2508.16143,
  title  = {Take That for Me: Multimodal Exophora Resolution with Interactive Questioning for Ambiguous Out-of-View Instructions},
  author = {Akira Oyama and Shoichi Hasegawa and Akira Taniguchi and Yoshinobu Hagiwara and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2508.16143},
  year   = {2025}
}

备注

See website at https://emergentsystemlabstudent.github.io/MIEL/. Accepted at IEEE RO-MAN 2025