面向物理机器人实时控制的异步强化学习
机器人学
2022-04-01 v3 人工智能
摘要
现实世界强化学习一个常被忽视的挑战在于,当智能体进行学习更新时,真实世界并不会暂停。由于标准仿真环境未涉及这一实时学习方面,大多数可用的 RL 算法实现都顺序地处理环境交互与学习更新。因此,当此类实现部署到真实世界中时,它们可能基于严重延迟的观测做出决策,且无法做出响应式动作。异步学习被提出以解决该问题,但此前尚未使用真实世界环境对顺序与异步强化学习进行系统比较。本工作中,我们搭建了基于视觉的机器人臂任务,实现了扩展先前架构的异步学习系统,并在不同动作周期时间、感官数据维度与 mini-batch 大小下比较顺序与异步强化学习。我们的实验表明,当学习更新的时间开销增加时,顺序实现中的动作周期时间可能增长过长,而异步实现始终能维持恰当的动作周期时间。因此,当学习更新代价高昂时,顺序学习的性能下降,并被异步学习大幅超越。我们的系统利用真实机器人从零开始在两小时经验内实时从像素中学习到达并跟踪视觉目标,完全从零开始学习。
引用
@article{arxiv.2203.12759,
title = {Asynchronous Reinforcement Learning for Real-Time Control of Physical Robots},
author = {Yufeng Yuan and A. Rupam Mahmood},
journal= {arXiv preprint arXiv:2203.12759},
year = {2022}
}
备注
Appears in Proceedings of the 2022 International Conference on Robotics and Automation (ICRA). Source code at https://github.com/YufengYuan/ur5_async_rl and companion video at https://youtu.be/B9icTcV1wNQ