拟随机逼近的最优收敛速率
最优化与控制
2019-03-19 v1
摘要
Robbins-Monro 随机逼近算法是许多强化学习(RL)算法框架的基础,且常是求解(或近似求解)复杂最优控制问题的有效途径。然而,在许多情况下,实践者因固有的高方差而无法应用这些技术。本文旨在为“拟随机逼近”提供一般基础,其中所考虑的所有过程均为确定性的,颇似拟蒙特卡洛在仿真中的方差缩减。在调节算法中相关参数的条件下,方差缩减可能极为显著。本文引入一种新的耦合论证,在增益足够大时建立最优收敛速率。这些结果针对线性模型建立,并在非理想设定中亦作了检验。这些一般结果的一个主要应用是一类针对确定性状态空间模型的新型 RL 算法。在此设定下,主要贡献是一类用于近似给定策略价值函数的算法,其使用另一设计为引入探索的策略。
引用
@article{arxiv.1903.07228,
title = {Optimal Rate of Convergence for Quasi-Stochastic Approximation},
author = {Andrey Bernstein and Yue Chen and Marcello Colombino and Emiliano Dall'Anese and Prashant Mehta and Sean Meyn},
journal= {arXiv preprint arXiv:1903.07228},
year = {2019}
}