贪心步长离策略强化学习
机器学习
2021-12-16 v4 人工智能
多智能体系统
摘要
大多数策略评估算法基于贝尔曼期望方程与最优方程的理论,由此衍生出两种流行方法——策略迭代(PI)与值迭代(VI)。然而,在基于 PI 的方法中,多步自举常与离策略学习相矛盾,原因在于多步离策略修正的大方差。相比之下,基于 VI 的方法天然为离策略,但受限于单步学习。本文利用多步自举与最优值函数的潜在结构,推导出一种新颖的多步贝尔曼最优方程。通过该新方程,我们推导出一种新的多步值迭代方法,其以指数收缩率 收敛至最优值函数,且仅具线性计算复杂度。此外,它可自然导出一系列多步离策略算法,能够安全利用任意策略收集的数据而无需修正。实验表明,所提方法可靠、易于实现,并在一系列标准基准数据集上取得最先进性能。
引用
@article{arxiv.2102.11717,
title = {Greedy-Step Off-Policy Reinforcement Learning},
author = {Yuhui Wang and Qingyuan Wu and Pengcheng He and Xiaoyang Tan},
journal= {arXiv preprint arXiv:2102.11717},
year = {2021}
}