中文

贪心步长离策略强化学习

机器学习 2021-12-16 v4 人工智能 多智能体系统

摘要

大多数策略评估算法基于贝尔曼期望方程与最优方程的理论,由此衍生出两种流行方法——策略迭代(PI)与值迭代(VI)。然而,在基于 PI 的方法中,多步自举常与离策略学习相矛盾,原因在于多步离策略修正的大方差。相比之下,基于 VI 的方法天然为离策略,但受限于单步学习。本文利用多步自举与最优值函数的潜在结构,推导出一种新颖的多步贝尔曼最优方程。通过该新方程,我们推导出一种新的多步值迭代方法,其以指数收缩率 O(γn)\mathcal{O}(\gamma^n) 收敛至最优值函数,且仅具线性计算复杂度。此外,它可自然导出一系列多步离策略算法,能够安全利用任意策略收集的数据而无需修正。实验表明,所提方法可靠、易于实现,并在一系列标准基准数据集上取得最先进性能。

关键词

引用

@article{arxiv.2102.11717,
  title  = {Greedy-Step Off-Policy Reinforcement Learning},
  author = {Yuhui Wang and Qingyuan Wu and Pengcheng He and Xiaoyang Tan},
  journal= {arXiv preprint arXiv:2102.11717},
  year   = {2021}
}