面向离线强化学习的对抗训练 Actor-Critic
机器学习
2022-07-07 v2
摘要
我们提出对抗训练 Actor-Critic(ATAC),一种基于相对悲观概念、用于数据覆盖不足情况下离线强化学习(RL)的无模型新算法。ATAC 被设计为一个双人 Stackelberg 博弈:策略 actor 与一个对抗训练的值 critic 竞争,后者寻找数据一致的情形,其中 actor 劣于数据收集的行为策略。我们证明,当 actor 在该双人博弈中达到无遗憾时,运行 ATAC 产生的策略可证明地 1)在控制悲观程度的广泛超参数范围内优于行为策略,且 2)以适当选择的超参数与数据所覆盖的最佳策略竞争。与现有工作相比,值得注意的是我们的框架既为通用函数逼近提供了理论保证,又提供了可扩展到复杂环境和大型数据集的深度 RL 实现。在 D4RL 基准上,ATAC 在一系列连续控制任务上持续优于最先进的离线 RL 算法。
引用
@article{arxiv.2202.02446,
title = {Adversarially Trained Actor Critic for Offline Reinforcement Learning},
author = {Ching-An Cheng and Tengyang Xie and Nan Jiang and Alekh Agarwal},
journal= {arXiv preprint arXiv:2202.02446},
year = {2022}
}