中文

利用锚定加速值迭代

机器学习 2023-10-31 v2 最优化与控制

摘要

值迭代(VI)是现代强化学习理论与实践的基石,已知其以O(γk)\mathcal{O}(\gamma^k)的速率收敛,其中γ\gamma为折扣因子。然而令人惊讶的是,VI设置的最优速率此前未知,且寻找通用加速机制一直是一个开放问题。本文中,我们提出首个针对Bellman一致性与最优算子的加速VI。我们的方法称为Anc-VI,基于一种\emph{锚定}机制(不同于Nesterov加速),其比标准VI更快地降低Bellman误差。特别地,Anc-VI在γ1\gamma\approx 1甚至γ=1\gamma=1时展现出O(1/k)\mathcal{O}(1/k)速率,而标准VI在γ11/k\gamma\ge 1-1/k时速率为O(1)\mathcal{O}(1),其中kk为迭代次数。我们还提供了复杂度下界,与上限仅相差常数因子44,从而确立了Anc-VI加速速率的最优性。最后,我们展示了锚定机制在近似VI与Gauss--Seidel VI设置中同样带来益处。

关键词

引用

@article{arxiv.2305.16569,
  title  = {Accelerating Value Iteration with Anchoring},
  author = {Jongmin Lee and Ernest K. Ryu},
  journal= {arXiv preprint arXiv:2305.16569},
  year   = {2023}
}