面向模糊离视图指令的多模态外指代解析:基于交互式提问
机器人学
2025-08-25 v1 人工智能
摘要
日常生活支持机器人必须解释涉及指示代词(如“请把那杯水给我”)的模糊语言指令,即使目标物体或用户不在机器人视野中。现有方法主要依赖视觉数据,难以应用于目标物体或用户不可见的实际场景。我们提出一种基于声源定位(SSL)、语义映射、视觉语言模型(VLMs)和与GPT-4o交互式提问的多模态外指代解析框架(MIEL)。该方法首先构建环境语义地图,通过用户骨骼数据估计 linguistic 查询的候选物体。利用SSL使机器人指向最初不在其视野内的用户,实现对用户手势和指向方向的精准识别。当剩余歧义时,机器人主动与用户交互,并利用GPT-4o制定澄清问题。实验表明,在实际环境中,相较于不使用SSL和交互式提问的方法,用户可见时性能提升约1.3倍,用户不可见时提升约2.0倍。项目网站为 https://emergentsystemlabstudent.github.io/MIEL/。
引用
@article{arxiv.2508.16143,
title = {Take That for Me: Multimodal Exophora Resolution with Interactive Questioning for Ambiguous Out-of-View Instructions},
author = {Akira Oyama and Shoichi Hasegawa and Akira Taniguchi and Yoshinobu Hagiwara and Tadahiro Taniguchi},
journal= {arXiv preprint arXiv:2508.16143},
year = {2025}
}
备注
See website at https://emergentsystemlabstudent.github.io/MIEL/. Accepted at IEEE RO-MAN 2025