中文

面向真实数据集的离线强化学习:异方差性与支撑约束

机器学习 2022-11-22 v2 机器学习

摘要

离线强化学习(RL)完全从静态数据集中学习策略,从而避免了在线数据收集相关的挑战。离线RL的实际应用将不可避免地需要从这样的数据集中学习:其中示范行为的变异性在状态空间中非均匀地变化。例如,在红灯处,几乎所有人类驾驶员都通过停车表现出相似行为,但在并入高速公路时,一些驾驶员快速、高效且安全地并入,而许多人犹豫或危险地并入。我们从理论和经验上表明,典型的基于分布约束的离线RL方法无法从具有此类非均匀变异性的数据中学习,因为要求在整个状态空间中以相同程度接近行为策略。理想情况下,只要所学策略保持在行为策略的支撑内,所学策略应可逐状态自由地选择接近行为策略的程度以最大化长期回报。为实例化该原理,我们在保守Q学习(CQL)中重新加权数据分布,以获得近似支撑约束公式。重新加权的分布是当前策略与另一个经训练用于挖掘行为策略下高概率不良动作的附加策略的混合。我们的方法CQL (ReDS)简单、有理论动机,并在Atari游戏、导航和基于像素的操作等广泛离线RL问题上提升了性能。

关键词

引用

@article{arxiv.2211.01052,
  title  = {Offline RL With Realistic Datasets: Heteroskedasticity and Support Constraints},
  author = {Anikait Singh and Aviral Kumar and Quan Vuong and Yevgen Chebotar and Sergey Levine},
  journal= {arXiv preprint arXiv:2211.01052},
  year   = {2022}
}