中文

打开黑盒:面向时间相关情景式强化学习的基于步的策略更新

机器学习 2024-01-23 v1 机器人学

摘要

当前强化学习(RL)的进展主要集中在学习为每个感知状态生成动作的基于步的策略上。虽然这些方法有效地利用了环境交互中的步信息,但它们通常忽略了动作之间的时间相关性,导致探索效率低下且轨迹不平滑,难以在真实硬件上实现。情景式强化学习(ERL)试图通过在捕获动作相关性的参数空间中进行探索来克服这些挑战。然而,这些方法通常牺牲了数据效率,因为它们将轨迹视为不透明的黑盒。在本工作中,我们引入了一种新颖的 ERL 算法,即时间相关情景式强化学习(TCE),它在情景式策略更新中有效地利用了步信息,在保留参数空间中平滑且一致的探索的同时,打开了现有 ERL 方法中的“黑盒”。TCE 协同地结合了基于步和情景式 RL 的优势,在实现与近期 ERL 方法相当的性能的同时,保持了与最先进(SoTA)的基于步 RL 相当的数据效率。

关键词

引用

@article{arxiv.2401.11437,
  title  = {Open the Black Box: Step-based Policy Updates for Temporally-Correlated Episodic Reinforcement Learning},
  author = {Ge Li and Hongyi Zhou and Dominik Roth and Serge Thilges and Fabian Otto and Rudolf Lioutikov and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2401.11437},
  year   = {2024}
}

备注

Codebase, see: https://github.com/BruceGeLi/TCE_RL