双曲贴现与多时间尺度上的学习
机器学习
2019-03-01 v3 机器学习
摘要
强化学习(RL)通常将折扣因子定义为马尔可夫决策过程的一部分。折扣因子通过指数方案对未来奖励进行估值,从而带来贝尔曼方程的理论收敛保证。然而,来自心理学、经济学与神经科学的证据表明,人类与动物反而具有双曲时间偏好。在本工作中,我们重新审视 RL 中贴现的基本原理,并通过实现一个基于双曲贴现行动的 RL 智能体来弥合这一脱节。我们证明,一种简单的方法可在仍使用 RL 中常见时序差分学习技术的同时逼近双曲贴现函数。此外,且与双曲贴现无关,我们有一个令人惊讶的发现:同时在多个时间尺度上学习价值函数是一项有效的辅助任务,其表现常常优于强大的基于价值的 RL 智能体 Rainbow。
引用
@article{arxiv.1902.06865,
title = {Hyperbolic Discounting and Learning over Multiple Horizons},
author = {William Fedus and Carles Gelada and Yoshua Bengio and Marc G. Bellemare and Hugo Larochelle},
journal= {arXiv preprint arXiv:1902.06865},
year = {2019}
}