Softmax策略梯度方法的收敛可能耗费指数级时间
机器学习
2022-12-19 v3 信息论
系统与控制
系统与控制
math.IT
最优化与控制
机器学习
摘要
Softmax策略梯度(PG)方法在softmax策略参数化下执行梯度上升,可以说是现代强化学习中策略优化的事实标准实现之一。对于 折扣无限 horizon 表格马尔可夫决策过程(MDP),近期在建立softmax PG方法寻找近最优策略的全局收敛性方面取得了显著进展。然而,先前的结果未能清晰刻画收敛速率对显著参数(如状态空间 的基数和有效 horizon )的明确依赖,而这些参数都可能过大。在本文中,我们给出了关于softmax PG方法迭代复杂度的悲观结论,尽管假设可获取精确梯度计算。具体而言,我们证明步长为 的softmax PG方法可能需要 才能收敛,即使在存在良性策略初始化和利于探索的初始状态分布(从而使得分布失配系数不过大)的情况下。这是通过在一个仅含三个动作的精心构造的MDP上刻画算法动态来实现的。我们的指数下界暗示了在加速PG方法时有必要仔细调整更新规则或施加适当的正则化。
引用
@article{arxiv.2102.11270,
title = {Softmax Policy Gradient Methods Can Take Exponential Time to Converge},
author = {Gen Li and Yuting Wei and Yuejie Chi and Yuxin Chen},
journal= {arXiv preprint arXiv:2102.11270},
year = {2022}
}
备注
accepted to Mathematical Programming (Series A); also presented in part in Conference on Learning Theory (COLT) 2021