可数状态空间平均成本强化学习中NPG的性能
机器学习
2024-09-23 v2 最优化与控制
摘要
我们考虑状态空间任意大甚至可数无穷的强化学习设置中的策略优化方法。该动机源于通信网络、匹配市场及其他排队系统中的控制问题。具体地,我们研究流行的自然策略梯度(NPG)算法,该算法过去仅在成本有界且状态空间有限的假设下被研究,而这两个假设对于前述控制问题均不成立。假设Lyapunov漂移条件(该条件在某些情况下自然满足,在其他情况下可以以较小的性能代价满足),我们设计了一个状态依赖的步长规则,显著提升了NPG在我们预期应用中的性能。除了实验验证性能提升外,我们还从理论上证明NPG的迭代复杂度可以独立于状态空间的大小。我们使用的关键分析工具是NPG步长与泊松方程解之间的联系。特别地,我们给出了泊松方程解的策略无关界,并用于指导NPG步长的选择。
引用
@article{arxiv.2405.20467,
title = {Performance of NPG in Countable State-Space Average-Cost RL},
author = {Yashaswini Murthy and Isaac Grosof and Siva Theja Maguluri and R. Srikant},
journal= {arXiv preprint arXiv:2405.20467},
year = {2024}
}
备注
24 pages; 3 figures