IntenBot:面向休闲类人 HRI 的灵活非精确多模态输入以助 LLM 理解用户意图
人机交互
2026-05-07 v1
摘要
在人与人之间的自然交流中,多模态用户输入通常用于补充显性语音指令并补全隐性语音指令,其随意性允许灵活的输入模态组合和对非精确输入数据的容忍。例如,在人与人交流中,说一句“我要那个。”并随意瞥一眼水瓶,作为伴随目光和/或手势的隐性语音指令而非显性指令,已经足够清晰。为了在人机交互(HRI)中实现此类类人交互,我们提出了一种系统 IntenBot,旨在从 XR 中的语音、目光和手指指向等灵活且非精确的多模态输入中理解用户意图。该系统利用大语言模型(LLM)的消歧能力来过滤无关输入模态和非精确输入数据,生成潜在指令供用户确认。灵活且非精确的多模态输入实现了与机器人休闲、类人的交互,减少了时间、精力和注意力的消耗,也可作为非语音输入使用。我们在模拟环境中进行了一项信息性用户行为研究,以了解用户在使用多模态输入与机器人灵活交互时的自然行为,并获取目光和手指指向的合适角度范围参数。随后我们进行了一项 XR 研究以评估 IntenBot 与其他方法相比的性能。我们还将 IntenBot 部署在物理机器人上,以展示其现实世界应用。
引用
@article{arxiv.2605.04585,
title = {IntenBot: Flexible and Imprecise Multimodal Input for LLMs to Understand User Intentions for Casual and Human-Like HRI},
author = {Yen-Ting Liu and Chiu-Hsuan Wang and TzuLing Chen and Ting-Ying Lee and Tzu-Hua Wang and Chien-Ming Lin and Bing-Yu Chen and Hsin-Ruey Tsai},
journal= {arXiv preprint arXiv:2605.04585},
year = {2026}
}