中文

离线强化学习中的泛化差距

机器学习 2024-03-18 v2 人工智能

摘要

尽管离线学习近期取得了进展,但这些方法仍在相同的环境中进行训练和测试。在本文中,我们比较了广泛使用的在线与离线学习方法的泛化能力,例如在线强化学习 (RL)、离线 RL、序列建模和行为克隆。我们的实验表明,离线学习算法在新环境中的表现逊于在线学习算法。我们还引入了首个用于评估离线学习泛化能力的基准,从 Procgen(2D 电子游戏)和 WebShop(电子商务网站)中收集了不同规模和技能水平的数据集。这些数据集包含有限游戏关卡或自然语言指令的轨迹,而在测试时,智能体必须泛化到新的关卡或指令。我们的实验表明,现有的离线学习算法在训练和测试环境中都难以匹敌在线 RL 的性能。行为克隆是一个很强的基线,当在来自多个环境的数据上训练并在新环境中测试时,其表现优于 SOTA 离线 RL 和序列建模方法。最后,我们发现增加数据的多样性而非规模,能提升所有离线学习算法在新环境上的性能。我们的研究证明了当前离线学习算法泛化能力有限,突出了该领域需要更多研究。

关键词

引用

@article{arxiv.2312.05742,
  title  = {The Generalization Gap in Offline Reinforcement Learning},
  author = {Ishita Mediratta and Qingfei You and Minqi Jiang and Roberta Raileanu},
  journal= {arXiv preprint arXiv:2312.05742},
  year   = {2024}
}

备注

Published as a conference paper at ICLR 2024; First two authors contributed equally