四房间环境下离策略预测学习算法的经验比较
机器学习
2021-09-14 v1 人工智能
摘要
过去十年中提出了许多离策略预测学习算法,但哪些算法学习速度快于其他算法仍不清楚。我们在两个小任务(Rooms 任务和 High Variance Rooms 任务)上以线性函数逼近经验比较了 11 种离策略预测学习算法。这些任务的设计使得在其中快速学习具有挑战性。在 Rooms 任务中,重要性采样率的乘积可高达 ,有时可为 2。为控制由重要性采样率乘积引起的高方差,步长应设小,这反过来减慢了学习。High Variance Rooms 任务更为极端,比率乘积可高达 。本文建立在 Ghiassian 与 Sutton(2021)对离策略预测学习算法的经验研究之上。我们考虑与其相同的算法集合并采用相同的实验方法。所考虑的算法为:离策略 TD()、五种 Gradient-TD 算法、两种 Emphatic-TD 算法、Tree Backup()、Vtrace() 和 ABTD()。我们发现算法性能高度受重要性采样率引起的方差影响。数据显示,Tree Backup()、Vtrace() 和 ABTD() 受高方差影响不如其他算法大,但它们以过于受限的方式限制了有效引导参数,对于不存在高方差的任务并不适用。我们观察到 Emphatic TD() 往往具有低于其他算法的渐近误差,但在某些情况下可能学习更慢。我们基于实践者感兴趣的问题给出算法建议,并给出可应用于特定算法以实质性改进算法的思路。
引用
@article{arxiv.2109.05110,
title = {An Empirical Comparison of Off-policy Prediction Learning Algorithms in the Four Rooms Environment},
author = {Sina Ghiassian and Richard S. Sutton},
journal= {arXiv preprint arXiv:2109.05110},
year = {2021}
}
备注
13 pages