中文

真实世界机器人中的同步与异步强化学习

机器人学 2025-03-20 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

近年来,利用物理机器人的强化学习(RL)吸引了广泛研究者的关注。然而,最先进的RL算法并未考虑到物理环境不会等待RL智能体做出决策或更新。RL智能体通过定期进行计算代价高昂的梯度更新来学习。当决策制定和梯度更新任务由物理机器人中的RL智能体顺序执行时,会显著增加智能体的响应时间。在快速变化的环境中,这种增加的响应时间可能对学习智能体的性能产生不利影响。异步RL方法将决策制定和梯度更新分离,是解决此问题的潜在方案。然而,目前仅有少数关于异步与同步RL在物理机器人上的比较。因此,使用异步RL方法相较于同步RL方法的确切性能优势尚不清楚。在本研究中,我们使用名为Franka Emika Panda的物理机械臂对异步与同步RL进行了性能比较。我们的实验表明,智能体使用异步RL学习更快,并获得显著更高的回报。我们的实验还表明,响应时间更快的学习智能体表现优于响应时间较慢的智能体,即使较慢的智能体执行了更多的梯度更新。

关键词

引用

@article{arxiv.2503.14554,
  title  = {Synchronous vs Asynchronous Reinforcement Learning in a Real World Robot},
  author = {Ali Parsaee and Fahim Shahriar and Chuxin He and Ruiqing Tan},
  journal= {arXiv preprint arXiv:2503.14554},
  year   = {2025}
}

备注

Presented at Alberta Robotics & Intelligent Systems Expo (RISE) Conference