FAM-HRI:基于基础模型的多模态人机交互融合注视与语音
人机交互
2026-05-19 v3 机器人学
摘要
有效的人机交互 (HRI) 对于增强现实机器人应用的可访问性和可用性至关重要。然而,现有解决方案常依赖手势指令或语言指令,导致交互效率低下且含义模糊,尤其是针对身体受损用户。本文介绍了 FAM-HRI,一个高效的多模态 HRI 框架,集成语言与注视输入 via 基础模型。通过利用轻量级 Meta ARIA 眼镜,我们的系统捕获实时多模态信号,并利用大语言模型 (LLM) 融合用户意图与场景上下文,实现直观且精确的机器人操作。我们的 method 准确确定注视固定时间间隔,减少因注视动态特性导致的噪声。实验评估表明,FAM-HRI 在任务执行中实现了高成功率,同时保持低的交互时间,为具有有限身体运动能力或运动受损的用户提供了实用解决方案。为支持社区研究,我们已在 https://github.com/laiyuzhi/FAM-HRI 发布了系统设计、算法和解决方案。
引用
@article{arxiv.2503.16492,
title = {FAM-HRI: Foundation-Model Assisted Multi-Modal Human-Robot Interaction Combining Gaze and Speech},
author = {Yuzhi Lai and Shenghai Yuan and Peizheng Li and Boya Zhang and Benjamin Kiefer and Tianchen Deng and Andreas Zell},
journal= {arXiv preprint arXiv:2503.16492},
year = {2026}
}
备注
This work has been accepted for publication in IEEE Transactions on Automation Science and Engineering @ 2026 IEEE