中文

对数线性策略参数化下自然策略梯度的线性收敛性

机器学习 2023-03-15 v2 最优化与控制 统计理论 统计理论

摘要

我们分析了无限 horizon 折扣马尔可夫决策过程中,采用对数线性(log-linear)策略参数化的无正则自然策略梯度算法的收敛速率。在确定性情形下,当 Q 值已知且可由已知特征函数的线性组合逼近至一偏差误差时,我们证明几何递增步长可带来朝向最优策略的线性收敛速率。我们随后考虑基于样本的情形,此时 Q 值函数在已知特征函数线性组合中的最佳表示已知至一估计误差。在该设定下,我们证明算法享有与确定性情形相同的线性保证,直至一个依赖于估计误差、偏差误差以及特征协方差矩阵条件数的误差项。我们的结果建立在策略镜像下降的一般框架之上,并将先前针对 softmax 表格参数化的结论扩展至对数线性策略类。

关键词

引用

@article{arxiv.2209.15382,
  title  = {Linear Convergence for Natural Policy Gradient with Log-linear Policy Parametrization},
  author = {Carlo Alfano and Patrick Rebeschini},
  journal= {arXiv preprint arXiv:2209.15382},
  year   = {2023}
}

备注

In the latest version we acknowledge concurrent work