中文

理解随机性在策略优化中的作用

机器学习 2021-11-01 v1

摘要

我们研究了同策略(on-policy)策略优化中随机性的影响,并作出以下四点贡献。首先,我们表明优化方法的可取性关键取决于使用的是随机梯度还是精确梯度。特别地,与真实梯度情形不同,在随机情形下,若不带来有害后果或做出不切实际的假设,几何信息无法被轻易利用来加速策略优化。其次,为解释这些发现,我们引入了随机策略优化的承诺率(committal rate)概念,并表明其可作为判定几乎必然收敛到全局最优性的准则。第三,我们表明在缺乏外部预言机信息(该信息使算法仅给定同策略样本就能确定最优与次优动作之间的差异)的情况下,在利用几何加速收敛与几乎必然达到最优之间存在固有的权衡。也就是说,一个无信息的算法要么以概率 11 收敛到全局最优策略但速率不优于 O(1/t)O(1/t),要么实现快于 O(1/t)O(1/t) 的收敛但必须以某个正概率无法收敛到全局最优策略。最后,我们利用承诺率理论解释了为何实际策略优化方法对随机初始化敏感,进而开发了一种集成方法,可保证以高概率获得近最优解。

关键词

引用

@article{arxiv.2110.15572,
  title  = {Understanding the Effect of Stochasticity in Policy Optimization},
  author = {Jincheng Mei and Bo Dai and Chenjun Xiao and Csaba Szepesvari and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2110.15572},
  year   = {2021}
}

备注

68 pages; Accepted at NeurIPS 2021