中文

近似与正则化策略迭代格式的收敛性研究

机器学习 2019-10-15 v2 机器学习

摘要

熵正则化算法如 Soft Q-learning 和 Soft Actor-Critic 近期在多项具有挑战性的强化学习(RL)任务上展示了最先进的性能。正则化公式修改了标准 RL 目标,因此通常收敛到不同于原始 RL 问题最优贪婪策略的策略。实际上,控制正则化最优策略的次优性十分重要。本文中,我们建立了大类正则化动态规划算法收敛的充分条件,这些算法统一于正则化修正策略迭代(MPI)和保守值迭代(VI)格式之下。我们给出了依赖于正则化参数衰减速率的到最优性的显式收敛速率。我们的实验表明经验误差紧密跟随所建立的理论收敛速率。除最优性外,我们展示了正则化算法即便在无近似情况下也具备两种期望行为:对环境随机性的鲁棒性,以及策略迭代诱导轨迹的安全性。

关键词

引用

@article{arxiv.1909.09621,
  title  = {On the Convergence of Approximate and Regularized Policy Iteration Schemes},
  author = {Elena Smirnova and Elvis Dohmatob},
  journal= {arXiv preprint arXiv:1909.09621},
  year   = {2019}
}