中文

认清边界:离线 RL 中显式行为克隆的必要性

机器学习 2022-06-03 v1

摘要

我们引入一种离线强化学习(RL)算法,该算法显式克隆行为策略以约束价值学习。在离线 RL 中,防止策略选择未观测动作通常很重要,因为这些动作的后果在没有环境额外信息的情况下无法假定。实现此类约束的一种直接方法是经由行为克隆显式建模给定数据分布,并直接强制策略不选择不确定动作。然而,许多离线 RL 方法由于对可能复杂的行为策略建模时误差的担忧,而间接实例化该约束——例如悲观价值估计。在本工作中,我们认为对离线 RL 显式建模行为策略不仅可行而且有益,因为该约束可通过训练好的模型以稳定方式实现。我们首先提出一个理论框架,允许我们将行为克隆模型纳入基于价值的离线 RL 方法中,兼具显式行为克隆与价值学习的优势。然后,我们提出一种利用基于分数的生成模型进行行为克隆的实用方法。使用所提方法,我们在 D4RL 和 Robomimic 基准中的多个数据集上展示了最先进的性能,并在所有测试数据集上取得了有竞争力的表现。

关键词

引用

@article{arxiv.2206.00695,
  title  = {Know Your Boundaries: The Necessity of Explicit Behavioral Cloning in Offline RL},
  author = {Wonjoon Goo and Scott Niekum},
  journal= {arXiv preprint arXiv:2206.00695},
  year   = {2022}
}