利用锚定加速值迭代
机器学习
2023-10-31 v2 最优化与控制
摘要
值迭代(VI)是现代强化学习理论与实践的基石,已知其以的速率收敛,其中为折扣因子。然而令人惊讶的是,VI设置的最优速率此前未知,且寻找通用加速机制一直是一个开放问题。本文中,我们提出首个针对Bellman一致性与最优算子的加速VI。我们的方法称为Anc-VI,基于一种\emph{锚定}机制(不同于Nesterov加速),其比标准VI更快地降低Bellman误差。特别地,Anc-VI在甚至时展现出速率,而标准VI在时速率为,其中为迭代次数。我们还提供了复杂度下界,与上限仅相差常数因子,从而确立了Anc-VI加速速率的最优性。最后,我们展示了锚定机制在近似VI与Gauss--Seidel VI设置中同样带来益处。
引用
@article{arxiv.2305.16569,
title = {Accelerating Value Iteration with Anchoring},
author = {Jongmin Lee and Ernest K. Ryu},
journal= {arXiv preprint arXiv:2305.16569},
year = {2023}
}