面向基于视觉的机器人学的深度强化学习算法基准测试
机器人学
2022-01-13 v1 人工智能
摘要
本文对用于求解两个基于模拟视觉的机器人学问题的一些最先进强化学习算法进行了基准测试研究。本研究所考虑的算法包括软 actor-critic(SAC)、近端策略优化(PPO)、插值策略梯度(IPG),以及它们结合 Hindsight Experience Replay(HER)的变体。这些算法的性能分别在 PyBullet 的两个仿真环境 KukaDiverseObjectEnv 和 RacecarZEDGymEnv 上进行比较。这些环境中的状态观测以 RGB 图像形式给出,且动作空间是连续的,使其难以求解。我们提出了若干策略来提供在这些本质上为单目标问题上实现 HER 算法所需的中间 hindsight 目标。此外,提出了若干特征提取架构以在学习过程中引入空间与时间注意力。通过严格的仿真实验,确立了这些组件所带来的改进。据我们所知,针对上述两个基于视觉的机器人学问题尚无此类基准测试研究,这使其成为该领域的一项新颖贡献。
引用
@article{arxiv.2201.04224,
title = {Benchmarking Deep Reinforcement Learning Algorithms for Vision-based Robotics},
author = {Swagat Kumar and Hayden Sampson and Ardhendu Behera},
journal= {arXiv preprint arXiv:2201.04224},
year = {2022}
}
备注
8 pages, 9 figures, 1 table