中文

用于安全离线强化学习的对抗训练加权Actor-Critic

机器学习 2024-11-01 v2

摘要

我们提出了WSAC(加权安全Actor-Critic),一种在函数逼近下用于安全离线强化学习(RL)的新算法,该算法能够在数据覆盖有限的情况下,稳健地优化策略以改进任意参考策略。WSAC被设计为一个双人Stackelberg博弈,以优化一个改进的目标函数。Actor针对两个具有较小重要性加权Bellman误差的对抗训练价值评论家优化策略,这些评论家专注于Actor表现劣于参考策略的场景。在理论上,我们证明了当Actor采用无悔优化预言机时,WSAC实现了多项保证:首次在安全离线RL设定中,我们证明了WSAC能够生成一个优于任意参考策略同时保持相同安全水平的策略,这对于设计离线RL的安全算法至关重要。WSAC实现了对参考策略 1/N1/\sqrt{N} 的最优统计收敛速率,其中 NN 为离线数据集的大小。我们在理论上表明,WSAC在控制悲观程度的大范围超参数下均能保证安全的策略改进,这表明了其实际的稳健性。此外,我们提供了WSAC的实用版本,并在多个连续控制环境中将其与现有的最先进安全离线RL算法进行了比较。WSAC在一系列任务中优于所有基线,支持了理论结果。

关键词

引用

@article{arxiv.2401.00629,
  title  = {Adversarially Trained Weighted Actor-Critic for Safe Offline Reinforcement Learning},
  author = {Honghao Wei and Xiyue Peng and Arnob Ghosh and Xin Liu},
  journal= {arXiv preprint arXiv:2401.00629},
  year   = {2024}
}