TD 还是非 TD:深度强化学习中时间差分作用的分析
机器学习
2018-06-05 v1 人工智能
机器学习
摘要
我们对强化学习(RL)的理解受到了数十年前使用表格表示和线性函数逼近器所得理论与经验结果的塑造。这些结果表明,使用时序差分(TD)的 RL 方法优于直接的蒙特卡洛估计(MC)。这些结果在深度 RL 中是否成立?深度 RL 处理感知复杂的环境和深度非线性模型。本文中,我们借助专门设计的环境重新考察了 TD 在现代深度 RL 中的作用,这些环境控制了影响性能的特定因素,如奖励稀疏性、奖励延迟以及任务的感知复杂度。在将 TD 与无限 horizon 的 MC 比较时,我们能够在现代设定中复现经典结果。然而我们也发现,有限 horizon 的 MC 并不逊于 TD,即便奖励稀疏或延迟。这使得 MC 成为深度 RL 中 TD 的可行替代方案。
引用
@article{arxiv.1806.01175,
title = {TD or not TD: Analyzing the Role of Temporal Differencing in Deep Reinforcement Learning},
author = {Artemij Amiranashvili and Alexey Dosovitskiy and Vladlen Koltun and Thomas Brox},
journal= {arXiv preprint arXiv:1806.01175},
year = {2018}
}