MINT-RVAE:利用纯RGB相机数据的人体姿态与情绪信息进行人机交互的多线索意图预测
机器人学
2025-09-29 v1 计算机视觉与模式识别
摘要
高效检测人类与无处不在的机器人进行交互的意图对于有效的人机交互(Human-Robot Interaction, HRI)与协作至关重要。在过去十年中,深度学习在该领域获得了关注,现有大多数方法依赖多模态输入(如 RGB 结合深度,即 RGB-D),将感官数据的时间序列窗口分类为交互或非交互。相比之下,我们提出了一种新颖的纯 RGB 流水线,用于以帧级精度预测人类交互意图,从而实现更快的机器人响应和提升的服务质量。意图预测中的一个关键挑战是现实世界 HRI 数据集中固有的类别不平衡,这可能阻碍模型的训练和泛化。为解决这一问题,我们引入了 MINT-RVAE,一种合成序列生成方法,并辅以新的损失函数和训练策略,以增强在样本外数据上的泛化能力。我们的方法实现了最先进的性能(AUROC: 0.95),优于先前的工作(AUROC: 0.90-0.912),同时仅需 RGB 输入并支持精确的帧起始预测。最后,为支持未来的研究,我们公开发布了带有帧级人类交互意图标注的新数据集。
引用
@article{arxiv.2509.22573,
title = {MINT-RVAE: Multi-Cues Intention Prediction of Human-Robot Interaction using Human Pose and Emotion Information from RGB-only Camera Data},
author = {Farida Mohsen and Ali Safa},
journal= {arXiv preprint arXiv:2509.22573},
year = {2025}
}