利用先验知识的强化学习用于机器人时间最优路径跟踪
机器人学
2019-07-11 v1 系统与控制
系统与控制
摘要
时间最优路径跟踪作为工业机器人的一项重要工具,已引起众多研究者的关注。在大多数时间最优路径跟踪问题中,执行器转矩约束被假设为保守的,忽略了电机特性;即执行器转矩约束是速度相关的,且转矩与速度之间呈分段线性关系。然而,考虑到电机特性增加了求解难度,本研究提出一种利用先验知识的改进Q-learning算法用于机器人时间最优路径跟踪。在考虑Q-learning算法局限性的基础上,提出一种改进的动作值函数以提高收敛速度。所提算法利用奖惩思想,对满足约束条件的动作给予奖励,对违反约束条件的动作进行惩罚,最终获得满足约束条件的时间最优轨迹。通过实验验证了算法的有效性。
引用
@article{arxiv.1907.00388,
title = {Reinforcement Learning for Robotic Time-optimal Path Tracking Using Prior Knowledge},
author = {Jiadong Xiao and Lin Li and Yanbiao Zou and Tie Zhang},
journal= {arXiv preprint arXiv:1907.00388},
year = {2019}
}
备注
27 pages, 14 figures, 4 Tables