结合视频与语音的大语言模型人机交互方法
机器人学
2026-02-25 v1 人工智能
摘要
准确解释人类意图是人机交互中的核心挑战,也是实现人机之间更自然直观协作的关键要求。本 work 提出了一种新型多模态 HRI 框架,融合先进的视觉语言模型、语音处理技术和模糊逻辑,实现对 Dobot Magician 机器人机械臂的精准且自适应控制。该系统集成 Florence-2进行目标检测、Llama 3.1进行自然语言理解、Whisper进行语音识别,为用户提供了通过语音指令进行物体操作的无缝直观界面。通过联合解决场景感知与动作规划,该方法提升了命令解释与执行的可靠性。在消费级硬件上的实验评估显示,命令执行准确率达75%,凸显了该系统的鲁棒性与适应性。超出当前性能之外,所提出的架构为未来 HRI 研究提供了灵活可扩展的基础,为通过紧密耦合的语音与视觉语言处理,通向更加精致和自然的人机协作提供了实际路径。
引用
@article{arxiv.2602.20219,
title = {An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction},
author = {Guanting Shen and Zi Tian},
journal= {arXiv preprint arXiv:2602.20219},
year = {2026}
}
备注
Preprint currently under revision