中文

基于生成模型的KL熵正则化强化学习是极小极大的

机器学习 2022-05-31 v1 人工智能 机器学习

摘要

本工作中,我们考虑并分析带生成模型的免模型强化学习的样本复杂度。特别地,我们分析Geist等人(2019)与Vieillard等人(2020a)的镜像下降值迭代(MDVI),其在值与策略更新中使用Kullback-Leibler散度与熵正则化。我们的分析表明,当ε\varepsilon足够小时,其为寻找ε\varepsilon-最优策略近乎极小极大最优。这是首个理论结果表明,在所考量设定下,一种无方差缩减的简单免模型算法可近乎极小极大最优。

关键词

引用

@article{arxiv.2205.14211,
  title  = {KL-Entropy-Regularized RL with a Generative Model is Minimax Optimal},
  author = {Tadashi Kozuno and Wenhao Yang and Nino Vieillard and Toshinori Kitamura and Yunhao Tang and Jincheng Mei and Pierre Ménard and Mohammad Gheshlaghi Azar and Michal Valko and Rémi Munos and Olivier Pietquin and Matthieu Geist and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2205.14211},
  year   = {2022}
}

备注

29 pages, 6 figures