离线强化学习的简单要素
机器学习
2024-03-21 v1 人工智能
摘要
离线强化学习算法在与目标下游任务高度相关的数据集上已被证明是有效的。然而,利用一个新颖的测试平台(MOOD,其中轨迹来自异构源),我们表明现有方法在处理多样化数据时面临困难:当为相关但不同的任务收集的数据被简单添加到离线缓冲区时,它们的性能显著恶化。鉴于这一发现,我们开展了一项大规模实证研究,提出并测试了几个假设来解释这种失败。令人惊讶的是,我们发现规模而非算法考量是影响性能的关键因素。我们表明,像 AWAC 和 IQL 这样简单的方法在增加网络规模后,克服了在 MOOD 中因包含额外数据而产生的悖论性失败模式,并在经典的 D4RL 基准上显著优于先前的 SOTA 算法。
引用
@article{arxiv.2403.13097,
title = {Simple Ingredients for Offline Reinforcement Learning},
author = {Edoardo Cetin and Andrea Tirinzoni and Matteo Pirotta and Alessandro Lazaric and Yann Ollivier and Ahmed Touati},
journal= {arXiv preprint arXiv:2403.13097},
year = {2024}
}