深度强化学习与致命三元组
人工智能
2018-12-07 v1 机器学习
摘要
我们从强化学习理论中得知,时序差分学习在某些情况下可能失效。Sutton 和 Barto(2018)指出了函数逼近、自举(bootstrapping)和离策略学习这三个性质的致命三元组。当这三种性质结合时,学习可能发散,价值估计变得无界。然而,若干算法成功地将这三种性质结合在一起,这表明我们对它的理解至少存在部分空白。在这项工作中,我们研究在实践中致命三元组的影响,具体针对一类流行的深度强化学习模型——使用经验回放训练的深层 Q 网络(deep Q-networks),分析该系统的各组成部分如何在致命三元组的出现以及智能体性能中发挥作用。
引用
@article{arxiv.1812.02648,
title = {Deep Reinforcement Learning and the Deadly Triad},
author = {Hado van Hasselt and Yotam Doron and Florian Strub and Matteo Hessel and Nicolas Sonnerat and Joseph Modayil},
journal= {arXiv preprint arXiv:1812.02648},
year = {2018}
}