中文

高速公路型强化学习

机器学习 2024-05-29 v1 人工智能

摘要

从一组策略收集的多步骤离策略数据是强化学习(RL)的核心问题。基于重要性抽样(IS)的方法往往因IS比率的乘积导致方差较大。典型的无IS方法,如nn步Q学习,沿着动作轨迹的nn个时间步骤向前查看(nn称为前瞻深度),并直接利用离策略数据而无需额外调整。虽然对于恰当选择的nn,这些方法效果良好,但我们发现,这类无IS方法会对最优价值函数(VF)产生低估,尤其是当nn较大时,限制了其高效利用来自远程未来时间步骤信息的能力。为克服这一问题,我们引入一种新颖的、无IS的、多步骤离策略方法,旨在避免低估问题并收敛至最优VF。其核心是一个简单却非平凡的"高速公路门控"(highway gate),该门控通过与阈值比较来控制来自远程未来的信息流。高速公路门控保证了对任意nn和任意行为策略下的最优VF的收敛。这一方法催生了一系列新的无IS型离策略RL算法,即使nn非常大,也能安全地学习,从而实现从遥远未来对过去的快速信用分配。在奖励延迟显著的任务中,包括仅在游戏结束时给出奖励的视频游戏,我们的方法在众多现有多步骤离策略算法中均表现出色。

关键词

引用

@article{arxiv.2405.18289,
  title  = {Highway Reinforcement Learning},
  author = {Yuhui Wang and Miroslav Strupl and Francesco Faccio and Qingyuan Wu and Haozhe Liu and Michał Grudzień and Xiaoyang Tan and Jürgen Schmidhuber},
  journal= {arXiv preprint arXiv:2405.18289},
  year   = {2024}
}