中文

基于对数似然比融合的无人机与移动机器人可解释多模态手势识别

机器人学 2026-03-06 v2 人工智能

摘要

人类操作员仍经常暴露在灾难区和工业设施等危险环境中,此时对移动机器人和无人机进行直观且可靠的遥控操作至关重要。在此背景下,无手部遥控操作可增强操作员的移动性和 situational awareness,从而提高危险环境中的安全性。虽然已探索了基于视觉的手势识别作为一种无手部遥控方法,但其性能在遮挡、光照变化和杂乱背景下常常恶化,限制了其在实际操作中的适用性。为克服这些限制,我们提出了一种多模态手势识别框架,将来自 Apple Watch(用于手腕)的惯性数据(加速度计、陀螺仪和姿态)与来自定制手套的电容感信号相结合。我们设计一种基于对数似然比(LLR)的晚期融合策略,该策略不仅提升了识别性能,还通过量化各模态的贡献提供了解译性。为支持此项研究,我们引入了一个包含 20 种不同手势的数据集,灵感来自航空指挥信号,包含同步的 RGB 视频、IMU 和电容传感器数据。实验结果表明,我们的框架在性能上相当于最新视觉方法基准,同时显著降低了计算成本、模型规模和训练时间,非常适合实时机器人控制。我们因此强调了基于传感器的多模态融合作为面向移动机器人和无人机手势遥控的稳健且可解释解决方案的潜力。

关键词

引用

@article{arxiv.2602.23694,
  title  = {Interpretable Multimodal Gesture Recognition for Drone and Mobile Robot Teleoperation via Log-Likelihood Ratio Fusion},
  author = {Seungyeol Baek and Jaspreet Singh and Lala Shakti Swarup Ray and Hymalai Bello and Paul Lukowicz and Sungho Suh},
  journal= {arXiv preprint arXiv:2602.23694},
  year   = {2026}
}