中文

碰撞任务中离屏策略预测学习算法的经验比较

机器学习 2021-06-15 v2 人工智能

摘要

离屏策略预测——从遵循另一策略所生成的数据中学习某一策略的价值函数——是强化学习中最具挑战性的子问题之一。本文给出了十一种 prominent 的采用线性函数近似的离屏策略学习算法的经验结果:五种 Gradient-TD 方法、两种 Emphatic-TD 方法、Off-policy TD(λ\lambda)、Vtrace,以及经过修改以适用于预测设置的 Tree Backup 和 ABQ 的版本。我们的实验使用了 Collision 任务,这是一个小型理想化离屏策略问题,类似于自动驾驶汽车试图预测其是否会与障碍物碰撞。我们根据学习率、渐近误差水平以及对步长和自助法参数的敏感性来评估这些算法的性能。依据这些指标,这十一种算法在 Collision 任务上可得到部分排序。在顶层,两种 Emphatic-TD 算法学习最快、达到最低误差且对参数设置具有鲁棒性。在中间层,五种 Gradient-TD 算法和 Off-policy TD(λ\lambda) 对自助法参数更为敏感。底层包括 Vtrace、Tree Backup 和 ABQ;这些算法并不更快,且渐近误差高于其他算法。我们的结果对该任务而言是确定的,当然,在能对算法优劣做出整体评估之前还需更多任务的实验。

关键词

引用

@article{arxiv.2106.00922,
  title  = {An Empirical Comparison of Off-policy Prediction Learning Algorithms on the Collision Task},
  author = {Sina Ghiassian and Richard S. Sutton},
  journal= {arXiv preprint arXiv:2106.00922},
  year   = {2021}
}