有或无感官反馈的时间优化路径跟踪学习
机器人学
2022-10-21 v2 人工智能
摘要
本文提出一种基于学习的方法,使机器人能够快速跟踪关节空间中定义的参考路径,且不超出各关节的位置、速度、加速度和加加速度限制。与离线的时间最优路径参数化方法不同,参考路径可在运动执行过程中更改。此外,我们的方法可利用感官反馈,例如使双足机器人跟随参考路径而不失平衡。该方法中,机器人由经强化学习训练、使用物理模拟器生成的数据的神经网络控制。从数学角度看,以时间优化方式跟踪参考路径的问题被形式化为马尔可夫决策过程。每个状态包含指定参考路径下一部分的固定数量路点。动作空间的设计使得所有生成的运动均符合指定的运动学关节限制。奖励函数最终反映了执行时间、与期望参考路径的偏差以及如平衡等可选附加目标之间的权衡。我们对该方法在有和无附加目标下进行了评估,表明时间优化路径跟踪可成功学习用于工业机器人和人形机器人。此外,我们证明了在模拟中训练的网络可成功迁移至真实机器人。
引用
@article{arxiv.2203.01968,
title = {Learning Time-optimized Path Tracking with or without Sensory Feedback},
author = {Jonas C. Kiemel and Torsten Kröger},
journal= {arXiv preprint arXiv:2203.01968},
year = {2022}
}
备注
IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2022); 8 pages, 11 figures; A video presentation is available at https://youtu.be/hBukfMs6We8