中文

双重异步值迭代:使值迭代在动作上异步

机器学习 2022-11-29 v2

摘要

值迭代(VI)是一种基础的动态规划方法,对于最优控制与强化学习中的学习和规划十分重要。VI 以批处理方式推进,其中每个状态的值更新必须完成后才能开始下一批更新。如果状态空间很大,完成单批更新的代价高得令人望而却步,使得 VI 在许多应用中不切实际。异步 VI 通过一次就地、以任意顺序更新一个状态,有助于解决大状态空间问题。然而,异步 VI 仍需要对整个动作空间进行最大化,使其在具有大动作空间的领域中不切实际。为解决此问题,我们提出双重异步值迭代(DAVI),一种将异步思想从状态推广到状态与动作的新算法。更具体地,DAVI 对大小为任意用户定义子集的采样动作进行最大化。这种使用采样来减少计算的简单方法保持了与 VI 类似的良好理论性质,而无需在每次更新中等待对整个动作空间的完整扫描。在本文中,我们证明 DAVI 以概率 1 收敛到最优值函数,以概率 1-delta 近几何速率收敛,并在计算时间几乎匹配先前建立的 VI 界的情况下返回一个近最优策略。我们还在若干实验中实证展示了 DAVI 的有效性。

关键词

引用

@article{arxiv.2207.01613,
  title  = {Doubly-Asynchronous Value Iteration: Making Value Iteration Asynchronous in Actions},
  author = {Tian Tian and Kenny Young and Richard S. Sutton},
  journal= {arXiv preprint arXiv:2207.01613},
  year   = {2022}
}