模型基RL中的离线与在线学习:数据收集策略的经验教训
机器学习
2025-09-09 v1 人工智能
摘要
数据收集对于学习稳健的世界模型在基于模型的强化学习中至关重要。最常见的策略是通过在在线训练期间与环境交互来主动收集轨迹,或在离线数据集上进行训练。首先,学习任务无关环境动力学的本质使世界模型成为有效离线训练的良好候选人。然而,literature中对在线与离线数据对世界模型以及因此对最终任务性能影响的研究尚不充分。在本工作中,我们在模型基设置中研究这两种范式,进行31个不同环境的实验。首先,我们展示了在线智能体优于其离线对手。我们识别了离线智能体性能下降的关键挑战:在测试时遇到外部分布状态。这一问题是由于没有在线智能体中的自我纠正机制,导致离线数据集的有限状态空间覆盖导致智能体想象与真实滚动之间的不匹配,妨碍了策略训练。我们演示了通过允许在固定或自适应计划中进行额外的在线交互来缓解这一问题,恢复受限交互数据下的在线训练性能。我们还展示了 incorporating exploration data 可缓解离线智能体的性能下降。基于我们的见解,我们建议在收集大型数据集时添加探索数据,因为当前努力主要只关注专家数据。
引用
@article{arxiv.2509.05735,
title = {Offline vs. Online Learning in Model-based RL: Lessons for Data Collection Strategies},
author = {Jiaqi Chen and Ji Shi and Cansu Sancaktar and Jonas Frey and Georg Martius},
journal= {arXiv preprint arXiv:2509.05735},
year = {2025}
}
备注
Accepted at Reinforcement Learning Conference (RLC 2025); Code available at: https://github.com/swsychen/Offline_vs_Online_in_MBRL