具有任意时刻稳定保证的近最优策略优化
机器学习
2022-12-06 v3 机器学习
摘要
策略优化方法是应用最广泛的强化学习(RL)算法类别之一。然而,对这些方法的理论理解仍不充分。即使在片段式(时间非齐次)表格设定下,\citet{shani2020optimistic} 中基于策略方法的最先进理论结果仅为 ,其中 为状态数, 为动作数, 为片段长度, 为片段数,且与信息论下界 存在 的差距。为弥补该差距,我们提出了一种具有“任意时刻稳定(Stable at Any Time)”性质的新算法——基于参考的策略优化(RPO-SAT,\algnameacro)。我们证明了我们的算法达到 的遗憾值。当 时,忽略对数因子,我们的算法是极小极大最优的。据我们所知,RPO-SAT 是首个计算高效、近乎极小极大最优的表格 RL 基于策略算法。
引用
@article{arxiv.2112.10935,
title = {Nearly Optimal Policy Optimization with Stable at Any Time Guarantee},
author = {Tianhao Wu and Yunchang Yang and Han Zhong and Liwei Wang and Simon S. Du and Jiantao Jiao},
journal= {arXiv preprint arXiv:2112.10935},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2002.08243 by other authors