Efficient reinforcement learning by guiding generalist world models with non-curated data
机器学习
2025-05-20 v2 机器人学
摘要
利用离线数据是提高在线强化学习 (RL) 采样效率的有前景的方法。本文通过利用来自多个 embodiment 的丰富非精选数据(无奖励、质量混合、跨多个 embodiment 收集),扩大可用于离线-在线 RL 数据池的范围。虽然学习世界模型看似可行,但我们发现,针对许多任务进行粗略微调无法加速 RL 训练。通过仔细调查,我们将此失败归因于离线数据与在线数据之间分布迁移。在解决此问题和有效利用离线数据方面,我们提出了两种关键技术:i) 经验重排 ii) 执行指导。通过这些修改,非精选离线数据显著提高了 RL 的采样效率。在受限样本预算下,我们的方法在 72 个视觉运动任务(跨 6 个 embodiment)上实现了 102.8% 的相对 aggregate 分数提升。对于 locomotion 和机器人操作等具有挑战性的任务,优于利用离线数据的先前方法。
引用
@article{arxiv.2502.19544,
title = {Efficient Reinforcement Learning by Guiding Generalist World Models with Non-Curated Data},
author = {Yi Zhao and Aidan Scannell and Wenshuai Zhao and Yuxin Hou and Tianyu Cui and Le Chen and Dieter Büchler and Arno Solin and Juho Kannala and Joni Pajarinen},
journal= {arXiv preprint arXiv:2502.19544},
year = {2025}
}