中文

NVP-HRI:基于大语言模型的零样本自然语音与姿态人机交互

机器人学 2025-03-13 v1 人工智能

摘要

有效的人机交互(HRI)对于未来老龄化社会中的服务机器人至关重要。现有方案偏向于仅对已训练对象有效,在处理新对象时存在空白。目前,使用预定义手势或语言令牌与预训练对象进行交互的HRI系统对所有人,尤其是老年人都构成挑战。这些挑战包括难以回忆命令、记忆手势和学习新名称。本论文提出了NVP-HRI,一种直观的多模态HRI范式,结合语音命令与指示性姿态。NVP-HRI利用Segment Anything Model(SAM)分析视觉线索和深度数据,实现精确的结构化对象表示。通过预训练的SAM网络,NVP-HRI允许通过零样本预测与新对象进行交互,即使无需先验知识。NVP-HRI还与大语言模型(LLM)集成,用于多模态命令,协调对象选择和场景分布,实时生成无碰撞轨迹方案。我们还通过必要的控制语法调节动作序列,以降低LLM幻觉风险。在通用机器人上对多样化真实世界任务的评估显示,相比传统手势控制实现了高达59.2%的效率提升,如视频https://youtu.be/EbC7al2wiAc所示。我们的代码和设计将公开可用,地址:https://github.com/laiyuzhi/NVP-HRI.git。

关键词

引用

@article{arxiv.2503.09335,
  title  = {NVP-HRI: Zero Shot Natural Voice and Posture-based Human-Robot Interaction via Large Language Model},
  author = {Yuzhi Lai and Shenghai Yuan and Youssef Nassar and Mingyu Fan and Thomas Weber and Matthias Rätsch},
  journal= {arXiv preprint arXiv:2503.09335},
  year   = {2025}
}

备注

This work has been accepted for publication in ESWA @ 2025 Elsevier. Personal use of this material is permitted. Permission from Elsevier must be obtained for all other uses, including reprinting/redistribution, creating new works, or reuse of any copyrighted components of this work in other media