中文

何时应优先选择离线强化学习而非行为克隆?

机器学习 2022-04-13 v1

摘要

离线强化学习(RL)算法可以利用先前收集的经验获得有效策略,而无需任何在线交互。人们广泛认识到,离线 RL 即使从高度次优数据中也能提取出良好策略,而这一场景下模仿学习会得到无法超越生成该数据集的示范者的次优解。然而,从业者的另一个常见用例是从类似示范的数据中学习。在这种情况下,可以选择应用离线 RL,也可以使用行为克隆(BC)算法,后者通过监督学习来模仿数据集的一个子集。因此,很自然地会问:即使在 BC 是自然选择的情况下,当拥有等量专家数据时,离线 RL 方法何时能优于 BC?为回答此问题,我们刻画了即使仅提供专家数据也允许离线 RL 方法优于 BC 方法的环境特性。此外,我们表明,在充分含噪的次优数据上训练的策略甚至可以取得比使用专家数据的 BC 算法更好的性能,尤其在长视野问题上。我们通过在与机器人操作、迷宫导航和 Atari 游戏相关的诊断性及高维领域上、以多种数据分布进行的广泛实验验证了我们的理论结果。我们观察到,在稀疏奖励或噪声数据源等特定但常见的条件下,现代离线 RL 方法可以显著优于 BC。

关键词

引用

@article{arxiv.2204.05618,
  title  = {When Should We Prefer Offline Reinforcement Learning Over Behavioral Cloning?},
  author = {Aviral Kumar and Joey Hong and Anikait Singh and Sergey Levine},
  journal= {arXiv preprint arXiv:2204.05618},
  year   = {2022}
}

备注

ICLR 2022. First two authors contributed equally