基于步态原理与对抗评论家强化学习教导双足机器人行走
机器人学
2019-10-24 v1 机器学习
摘要
考虑到双足机器人的非线性和混合动力学特性,控制其稳定行走是一项具有挑战性的任务。强化学习可以通过直接将观测状态映射到最大化累积奖励的最优动作来解决这些问题。然而,由不适当奖励引起的局部极小值和累积奖励的高估阻碍了累积奖励的最大化。为了提高累积奖励,本文基于行走原理设计了一种步态奖励,以补偿非自然运动的局部极小值。此外,提出了一种带有循环神经网络(RNN)的对抗式双延迟深度确定性(ATD3)策略梯度算法,通过缓解累积奖励的高估来进一步提升累积奖励。在Roboschool Walker2d和Webots Atlas模拟器中的实验结果表明,加入步态奖励后测试奖励分别提高了23.50%和9.63%。使用ATD3_RNN后测试奖励进一步提高15.96%和12.68%,原因可能是ATD3_RNN将累积奖励估计误差从19.86%降低到3.35%。此外,由步态奖励和ATD3_RNN训练的人与双足机器人之间的余弦运动相似性提高了超过69.23%。因此,所设计的步态奖励和ATD3_RNN提升了累积奖励并更好地教导双足机器人行走。
引用
@article{arxiv.1910.10194,
title = {Teach Biped Robots to Walk via Gait Principles and Reinforcement Learning with Adversarial Critics},
author = {Kuangen Zhang and Zhimin Hou and Clarence W. de Silva and Haoyong Yu and Chenglong Fu},
journal= {arXiv preprint arXiv:1910.10194},
year = {2019}
}