中文

具有任意时刻稳定保证的近最优策略优化

机器学习 2022-12-06 v3 机器学习

摘要

策略优化方法是应用最广泛的强化学习(RL)算法类别之一。然而,对这些方法的理论理解仍不充分。即使在片段式(时间非齐次)表格设定下,\citet{shani2020optimistic} 中基于策略方法的最先进理论结果仅为 O~(S2AH4K)\tilde{O}(\sqrt{S^2AH^4K}),其中 SS 为状态数,AA 为动作数,HH 为片段长度,KK 为片段数,且与信息论下界 Ω~(SAH3K)\tilde{\Omega}(\sqrt{SAH^3K}) 存在 SH\sqrt{SH} 的差距。为弥补该差距,我们提出了一种具有“任意时刻稳定(Stable at Any Time)”性质的新算法——基于参考的策略优化(RPO-SAT,\algnameacro)。我们证明了我们的算法达到 O~(SAH3K+AH4K)\tilde{O}(\sqrt{SAH^3K} + \sqrt{AH^4K}) 的遗憾值。当 S>HS > H 时,忽略对数因子,我们的算法是极小极大最优的。据我们所知,RPO-SAT 是首个计算高效、近乎极小极大最优的表格 RL 基于策略算法。

关键词

引用

@article{arxiv.2112.10935,
  title  = {Nearly Optimal Policy Optimization with Stable at Any Time Guarantee},
  author = {Tianhao Wu and Yunchang Yang and Han Zhong and Liwei Wang and Simon S. Du and Jiantao Jiao},
  journal= {arXiv preprint arXiv:2112.10935},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2002.08243 by other authors