离线 Actor-Critic 强化学习可扩展至大型模型
机器学习
2024-02-09 v1 人工智能
机器人学
摘要
我们证明,离线 actor-critic 强化学习可以扩展到大型模型(如 Transformer),并遵循与监督学习相似的缩放法则。我们发现,在包含 132 个连续控制任务的次优和专家行为的大型数据集上进行多任务训练时,离线 actor-critic 算法可以优于强大的监督式行为克隆基线。我们引入了一个基于 Perceiver 的 actor-critic 模型,并阐明了使离线 RL 能够与自注意力和交叉注意力模块协同工作的关键模型特征。总的来说,我们发现:i) 简单的离线 actor critic 算法是逐渐摆脱当前盛行的行为克隆范式的一个自然选择;ii) 通过离线 RL,可以从次优演示或自生成数据中学习同时掌握多个领域的多任务策略,包括真实的机器人任务。
引用
@article{arxiv.2402.05546,
title = {Offline Actor-Critic Reinforcement Learning Scales to Large Models},
author = {Jost Tobias Springenberg and Abbas Abdolmaleki and Jingwei Zhang and Oliver Groth and Michael Bloesch and Thomas Lampe and Philemon Brakel and Sarah Bechtle and Steven Kapturowski and Roland Hafner and Nicolas Heess and Martin Riedmiller},
journal= {arXiv preprint arXiv:2402.05546},
year = {2024}
}