加速的模拟到现实深度强化学习:从人类玩家学习避障
人工智能
2021-02-24 v2 机器人学
摘要
本文提出一种用于移动机器人的传感器级无地图避障算法,该算法将原始传感器数据映射为线速度与角速度,并在无地图的未知环境中导航。提出了一种高效训练策略,使机器人能从人类经验数据与自我探索数据中学习。设计了一种游戏形式仿真框架,允许人类玩家遥操作移动机器人至目标,并使用奖励函数对人类动作进行评分。采用优先经验回放算法对人类玩家数据与自我对弈数据进行采样。所提算法与训练策略在两种不同实验配置下进行了评估:\textit{Environment 1},一种模拟杂乱环境,以及 \textit{Environment 2},一种模拟走廊环境,以考察性能。结果表明,在 Environment 1 中,所提方法仅使用标准深度确定性策略梯度(DDPG)方法所需训练步数的 16% 即达到同等奖励水平,在 Environment 2 中仅使用其 20%。在 20 个随机任务评估中,所提方法分别在两个 Gazebo 环境中以少于 2 小时和 2.5 小时训练时间实现零碰撞。该方法还生成比 DDPG 更平滑的轨迹。所提方法也在真实世界环境中的实际机器人上实现以评估性能。我们可以确认,使用仿真软件训练的模型可直接应用于真实世界场景而无需进一步微调,进一步证明了其比 DDPG 更高的鲁棒性。视频与代码见:https://youtu.be/BmwxevgsdGc https://github.com/hanlinniu/turtlebot3_ddpg_collision_avoidance
引用
@article{arxiv.2102.10711,
title = {Accelerated Sim-to-Real Deep Reinforcement Learning: Learning Collision Avoidance from Human Player},
author = {Hanlin Niu and Ze Ji and Farshad Arvin and Barry Lennox and Hujun Yin and Joaquin Carrasco},
journal= {arXiv preprint arXiv:2102.10711},
year = {2021}
}