高速公路型强化学习
机器学习
2024-05-29 v1 人工智能
摘要
从一组策略收集的多步骤离策略数据是强化学习(RL)的核心问题。基于重要性抽样(IS)的方法往往因IS比率的乘积导致方差较大。典型的无IS方法,如步Q学习,沿着动作轨迹的个时间步骤向前查看(称为前瞻深度),并直接利用离策略数据而无需额外调整。虽然对于恰当选择的,这些方法效果良好,但我们发现,这类无IS方法会对最优价值函数(VF)产生低估,尤其是当较大时,限制了其高效利用来自远程未来时间步骤信息的能力。为克服这一问题,我们引入一种新颖的、无IS的、多步骤离策略方法,旨在避免低估问题并收敛至最优VF。其核心是一个简单却非平凡的"高速公路门控"(highway gate),该门控通过与阈值比较来控制来自远程未来的信息流。高速公路门控保证了对任意和任意行为策略下的最优VF的收敛。这一方法催生了一系列新的无IS型离策略RL算法,即使非常大,也能安全地学习,从而实现从遥远未来对过去的快速信用分配。在奖励延迟显著的任务中,包括仅在游戏结束时给出奖励的视频游戏,我们的方法在众多现有多步骤离策略算法中均表现出色。
引用
@article{arxiv.2405.18289,
title = {Highway Reinforcement Learning},
author = {Yuhui Wang and Miroslav Strupl and Francesco Faccio and Qingyuan Wu and Haozhe Liu and Michał Grudzień and Xiaoyang Tan and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2405.18289},
year = {2024}
}