中文

一种用于 Softmax 策略的替代策略梯度估计器

机器学习 2022-02-25 v2 人工智能

摘要

策略梯度(PG)估计器在处理次优饱和的 softmax 策略时效果不佳,次优饱和指策略将其概率质量集中于次优动作的情形。次优策略饱和可能源于糟糕的策略初始化,或发生在策略已收敛后环境中的突变。当前的 softmax PG 估计器需要大量更新才能克服策略饱和,导致低样本效率与对新情境的较差适应性。为缓解此问题,我们提出一种用于 softmax 策略的新颖 PG 估计器,其利用评论家估计中的偏差与奖励信号中存在的噪声来逃离策略参数空间的饱和区域。我们的理论分析与在赌博机及多种强化学习环境中进行的实验表明,这一新估计器对策略饱和显著更具鲁棒性。

关键词

引用

@article{arxiv.2112.11622,
  title  = {An Alternate Policy Gradient Estimator for Softmax Policies},
  author = {Shivam Garg and Samuele Tosatto and Yangchen Pan and Martha White and A. Rupam Mahmood},
  journal= {arXiv preprint arXiv:2112.11622},
  year   = {2022}
}

备注

Accepted to AISTATS 2022. 60 pages, 50 figures. This updated version has an additional experiment and minor corrections