中文

视觉-状态融合:改进自主机器人的深度神经网络

机器人学 2024-08-06 v3

摘要

基于视觉的深度学习感知在机器人学中发挥着至关重要的作用,为诸多挑战性场景提供解决方案,如自主无人机(UAV)的特技机动与机器人辅助高精度手术。面向控制的端到端感知方法直接为机器人输出控制变量,通常利用机器人状态估计作为辅助输入。当估计中间输出并馈入底层控制器(即中介方法)时,机器人状态通常仅用作以自我为中心任务(估计机器人自身物理属性)的输入。本工作中,我们提出首次——据我们所知——将类似方法应用于非自我中心的中介任务,其中估计输出指向外部主体。我们证明了该通用方法如何以极小计算成本提升深度卷积神经网络(CNNs)在广泛非自我中心 3D 姿态估计问题上的回归性能。通过分析三个差异显著的用例(从机械臂抓取到口袋尺寸 UAV 跟随人体),我们的结果相较无状态基线一致提升了 R² 回归指标,最高达 +0.51。最后,我们在人体姿态估计任务上验证了闭环自主厘米级 UAV 的现场性能。结果显示,相较最先进(State-of-the-Art)无状态对应方法,我们的有状态 CNN 平均绝对误差显著降低,即平均降低 24%。

关键词

引用

@article{arxiv.2206.06112,
  title  = {Vision-State Fusion: Improving Deep Neural Networks for Autonomous Robotics},
  author = {Elia Cereda and Stefano Bonato and Mirko Nava and Alessandro Giusti and Daniele Palossi},
  journal= {arXiv preprint arXiv:2206.06112},
  year   = {2024}
}

备注

This paper has been accepted for publication in the Journal of Intelligent & Robotic Systems. \copyright 2024 Springer