RvS:通过监督学习进行离线 RL 的要素是什么?
机器学习
2022-05-12 v2 人工智能
机器学习
摘要
近期工作表明,仅用监督学习而不用时序差分(TD)学习,对离线 RL 可异常有效。这在何时成立,且哪些算法组件是必需的?通过大量实验,我们将离线 RL 的监督学习精简至其本质要素。在我们所考虑的每一个环境套件中,仅用两层前馈 MLP 最大化似然,便能与基于 TD 学习或 Transformer 序列建模的远为复杂方法的最先进结果相竞争。谨慎选择模型容量(如通过正则化或架构)以及选择以何种信息为条件(如目标或奖励)对性能至关重要。这些见解可作为使用监督学习进行强化学习(我们称之为“RvS 学习”)从业者的领域指南。它们也探查了现有 RvS 方法的局限,即在随机数据上相对较弱,并提出了若干开放问题。
引用
@article{arxiv.2112.10751,
title = {RvS: What is Essential for Offline RL via Supervised Learning?},
author = {Scott Emmons and Benjamin Eysenbach and Ilya Kostrikov and Sergey Levine},
journal= {arXiv preprint arXiv:2112.10751},
year = {2022}
}