处理实时强化学习中的延迟问题
机器学习
2025-04-01 v1 人工智能
机器人学
摘要
实时强化学习(RL)引入了若干挑战。首先,由于硬件限制,策略受限于每秒固定数量的动作。其次,环境可能在网络仍在计算动作时发生变化,导致观测延迟。第一项问题可以通过流水线化来部分解决,从而实现更高的吞吐量并可能获得更好的策略。然而,第二项问题仍然存在:如果每个神经元以 为并行执行时间,那么一个 层前馈网络将经历 的观测延迟。减少层数可以降低此延迟,但以牺牲网络表达能力为代价。本文探讨了在最小化延迟与网络表达能力之间权衡。我们提出了一种以理论为依据的解决方案,利用结合历史增强观测的时序跳跃连接。我们评估了多种架构,结果表明采用时序跳跃连接的架构在各种神经元执行时间、强化学习算法和环境下均表现出色,包括四个 Mujoco 任务和所有 MinAtar 游戏。此外,我们展示并行神经元计算可在标准硬件上加快 6-350% 的推理速度。我们对时序跳跃连接和并行计算的探索为在实时环境中构建更高效的 RL 智能体铺平了道路。
引用
@article{arxiv.2503.23478,
title = {Handling Delay in Real-Time Reinforcement Learning},
author = {Ivan Anokhin and Rishav Rishav and Matthew Riemer and Stephen Chung and Irina Rish and Samira Ebrahimi Kahou},
journal= {arXiv preprint arXiv:2503.23478},
year = {2025}
}
备注
Accepted at ICLR 2025. Code available at https://github.com/avecplezir/realtime-agent