基于循环确定性策略梯度的崎岖地形双足行走方法
人工智能
2020-02-11 v6 机器学习
机器人学
摘要
本文基于我们对循环确定性策略梯度(RDPG)的新颖解读,提出一个能够解决部分可观测行走任务的深度学习框架。我们分别研究了由环境部分可观测性和子轨迹采样引起的采样误差度量的偏差及其方差。在我们基于 RDPG 的学习框架中引入了三项主要改进:插值时间差分尾部自举、利用过去轨迹扫描初始化隐藏状态,以及注入由其他智能体学习到的外部经验。所提出的学习框架被用于解决 OpenAI Gym 仿真环境中仅提供部分状态信息的双足行走挑战。我们的仿真研究表明,RDPG 智能体生成的自主行为对多种障碍具有高度适应性,使智能体能够以比领先竞争者更高的成功率有效地长距离穿越崎岖地形。
引用
@article{arxiv.1710.02896,
title = {Recurrent Deterministic Policy Gradient Method for Bipedal Locomotion on Rough Terrain Challenge},
author = {Doo Re Song and Chuanyu Yang and Christopher McGreavy and Zhibin Li},
journal= {arXiv preprint arXiv:1710.02896},
year = {2020}
}
备注
Published in IEEE proceedings: 2018 15th International Conference on Control, Automation, Robotics and Vision (IEEE-ICARCV)