中文

MVSA-Net:用于鲁棒可部署轨迹生成的多视角状态-动作识别

计算机视觉与模式识别 2024-04-09 v3 人工智能 机器学习 机器人学

摘要

观察学习(LfO)范式是一种受人类启发的方式,让机器人仅通过观看任务执行过程来学习执行该任务。LfO 可通过最小化干扰和减少繁琐编程来促进机器人在工厂车间的集成。LfO 流程的一个关键组件是将深度相机帧转换为相应的任务状态与动作对,随后将其传递给模仿学习或逆强化学习等技术以理解任务参数。虽然若干现有计算机视觉模型分析视频进行活动识别,SA-Net 专门从 RGB-D 数据针对机器人 LfO。然而,SA-Net 及许多其他模型分析从单一视角捕获的帧数据。因此,它们的分析对观测任务中的遮挡高度敏感,而遮挡在部署中频繁发生。减少遮挡的一个明显方法是同时从多个视角观测任务,并在模型中同步融合多路流。为此,我们提出多视角 SA-Net,它将 SA-Net 模型推广以允许感知任务活动的多个视角、进行整合,并更好地识别每帧中的状态与动作。在两个不同领域的性能评估表明,与单视角 MVSA-Net 及其他基线相比,MVSA-Net 在遮挡下更准确地识别状态-动作对。我们的消融研究进一步评估了其在不同环境条件下的性能,并确立了架构组件的贡献。因此,MVSA-Net 相比以往方法提供了显著更鲁棒且可部署的状态-动作轨迹生成。

关键词

引用

@article{arxiv.2311.08393,
  title  = {MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation},
  author = {Ehsan Asali and Prashant Doshi and Jin Sun},
  journal= {arXiv preprint arXiv:2311.08393},
  year   = {2024}
}

备注

Presented at Deployable AI Workshop at AAAI-2024 and 'Towards Reliable and Deployable Learning-Based Robotic Systems' Workshop at CoRL2023