中文

基于方差正则化的强化学习离线策略优化

机器学习 2023-01-02 v1

摘要

从固定的离线数据集中学习策略是扩展强化学习(RL)算法以应用于实际场景的关键挑战。这通常是因为离策略 RL 算法受到分布偏移的困扰,由于数据集与目标策略之间的不匹配,导致高方差和价值函数的过高估计。在这项工作中,我们提出了针对离线 RL 算法的方差正则化方法,使用平稳分布校正。我们表明,通过利用 Fenchel 对偶性,可以避免计算方差正则化器梯度时的双重采样问题。所提出的离线方差正则化(OVAR)算法可用于增强任何现有的离线策略优化算法。我们表明该正则化器导出了离线策略优化目标的一个下界,有助于避免过高估计误差,并且与现有最先进算法相比,在一系列连续控制领域中解释了我们所提方法的优势。

关键词

引用

@article{arxiv.2212.14405,
  title  = {Offline Policy Optimization in RL with Variance Regularizaton},
  author = {Riashat Islam and Samarth Sinha and Homanga Bharadhwaj and Samin Yeasar Arnob and Zhuoran Yang and Animesh Garg and Zhaoran Wang and Lihong Li and Doina Precup},
  journal= {arXiv preprint arXiv:2212.14405},
  year   = {2023}
}

备注

Old Draft, Offline RL Workshop, NeurIPS'20;