中文

双生成器离线强化学习

机器学习 2022-11-04 v1 人工智能

摘要

在离线强化学习(RL)中,约束所学策略接近数据分布对于防止策略输出具有错误高估价值的分布外(OOD)动作至关重要。原则上,生成对抗网络(GAN)可以提供一种优雅的解决方案,其判别器直接提供量化分布偏移的概率。然而,在实践中,基于 GAN 的离线 RL 方法表现不如替代方法,可能是因为生成器被训练为既要欺骗判别器又要最大化回报——这两个目标可能相互冲突。在本文中,我们表明冲突目标的问题可以通过训练两个生成器来解决:一个最大化回报,另一个捕获离线数据集中数据分布的“剩余”部分,使得两者的混合接近行为策略。我们表明,拥有两个生成器不仅实现了一种有效的基于 GAN 的离线 RL 方法,而且近似于一种支撑约束,其中策略不需要匹配整个数据分布,而只需要匹配导致高长期性能的数据切片。我们将我们的方法命名为 DASCO,即双生成器对抗支撑约束离线 RL(Dual-Generator Adversarial Support Constrained Offline RL)。在需要从次优数据中学习的基准任务上,DASCO 显著优于先前实施分布约束的方法。

关键词

引用

@article{arxiv.2211.01471,
  title  = {Dual Generator Offline Reinforcement Learning},
  author = {Quan Vuong and Aviral Kumar and Sergey Levine and Yevgen Chebotar},
  journal= {arXiv preprint arXiv:2211.01471},
  year   = {2022}
}

备注

NeurIPS 2022