中文

面向有原则且实用的赌博机和表格MDP的策略梯度

机器学习 2024-10-01 v3

摘要

我们考虑(随机)softmax策略梯度(PG)方法用于赌博机和表格马尔可夫决策过程(MDP)。虽然PG目标是非凹的,但最近的研究利用目标的平滑性和梯度支配性质实现了向最优策略的收敛。然而,这些理论结果需要根据未知的问题相关量(例如赌博机问题中的最优动作或真实奖励向量)来设置算法参数。为了解决这个问题,我们从优化文献中借鉴思想,在精确和随机设置中设计了实用、有原则的PG方法。在精确设置中,我们采用Armijo线搜索来设置softmax PG的步长,并证明了线性收敛速度。在随机设置中,我们利用指数递减的步长,并描述了所得算法的收敛速度。我们表明,所提出的算法提供了与最先进结果相似的理论保证,但不需要先知般的量的知识。对于多臂赌博机设置,我们的技术产生了一个理论上合理的PG算法,该算法不需要显式探索、奖励间隙、奖励分布或噪声的知识。最后,我们将所提出的方法与需要先知知识的PG方法进行了经验比较,并展示了有竞争力的性能。

关键词

引用

@article{arxiv.2405.13136,
  title  = {Towards Principled, Practical Policy Gradient for Bandits and Tabular MDPs},
  author = {Michael Lu and Matin Aghaei and Anant Raj and Sharan Vaswani},
  journal= {arXiv preprint arXiv:2405.13136},
  year   = {2024}
}

备注

Accepted at RLC 2024