中文

化身博士与海德先生:离屏策略更新的奇异案例

机器学习 2021-10-01 v1 人工智能

摘要

策略梯度定理指出,策略只应在当前策略所访问的状态下进行更新,这导致在离屏状态下的规划不足,从而收敛到次优策略。我们通过将策略梯度理论扩展到针对任意状态密度的策略更新来解决这一规划问题。在这些广义策略更新下,我们展示了在更新的状态密度满足充要条件时收敛到最优,从而解决了上述规划问题。我们还证明了渐近收敛速率显著优于策略梯度文献中的结果。为实现我们理论所规定原则,我们提出了一个具有双重人格的智能体——化身博士与海德先生(JH):化身博士纯粹利用,而海德先生纯粹探索。JH 的独立策略允许记录两个独立的回放缓冲区:一个在屏(化身博士的)和一个离屏(海德先生的),从而能够以在屏与离屏更新混合的方式更新 JH 的模型。JH 不仅是一种算法,更定义了 actor-critic 算法需满足我们在分析中确定之要求的原则。我们在有限 MDP 上进行了广泛测试,JH 展现出从收敛到次优策略中恢复而不损害收敛速度的优越能力。我们还实现了该算法的深度版本,并在一个简单问题上测试,显示出有前景的结果。

关键词

引用

@article{arxiv.2109.14727,
  title  = {Dr Jekyll and Mr Hyde: the Strange Case of Off-Policy Policy Updates},
  author = {Romain Laroche and Remi Tachet},
  journal= {arXiv preprint arXiv:2109.14727},
  year   = {2021}
}

备注

accepted to NeurIPS as a poster