中文

TOP-ERL:基于Transformer的无策略回归制动强化学习

机器学习 2025-03-18 v4 机器人学

摘要

本工作引入Transformer-based Off-Policy Episodic Reinforcement Learning(TOP-ERL),一种新型算法,使ERL框架能够进行无策略更新。在ERL中,策略预测整个动作轨迹在多个时间步上,而不是在每个时间步上预测单个动作。这些轨迹通常由轨迹生成器(如运动原语)参数化,允许在多个时间步上平滑和高效地探索,同时捕获高层次的时间相关性。然而,ERL方法通常受限于基于策略框架,因为评估整个动作序列的状态-动作价值很困难,这限制了样本效率并阻止了使用更高效的无策略架构。TOP-ERL通过分割长动作序列并使用基于Transformer的批评架构以及n步返回估计来估计每个片段的状态-动作价值来解决这一不足。这些贡献结果在机器人学习环境中表现出高效和稳定的训练。TOP-ERL显著优于最先进的强化学习方法。经过充分的消融研究还显示关键设计选择对模型性能的影响。

关键词

引用

@article{arxiv.2410.09536,
  title  = {TOP-ERL: Transformer-based Off-Policy Episodic Reinforcement Learning},
  author = {Ge Li and Dong Tian and Hongyi Zhou and Xinkai Jiang and Rudolf Lioutikov and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2410.09536},
  year   = {2025}
}

备注

Accepted as a Spotlight at ICLR 2025