使深度 Q-learning 方法对时间离散化具有鲁棒性
机器学习
2019-01-30 v2 机器学习
摘要
尽管取得了显著成功,深度强化学习(DRL)对超参数化、实现细节或微小环境变化并不鲁棒(Henderson et al. 2017, Zhang et al. 2018)。克服这种敏感性是使 DRL 适用于现实世界问题的关键。在本文中,我们确定近连续时间环境中对时间离散化的敏感性为一个关键因素;这涵盖了例如改变每秒帧数或控制器的动作频率。经验上,我们发现基于 Q-learning 的方法如 Deep Q-learning(Mnih et al., 2015)和 Deep Deterministic Policy Gradient(Lillicrap et al., 2015)在较小时间步下会崩溃。形式上,我们证明 Q-learning 在连续时间中不存在。我们详述了一种构建离策略 RL 算法的原则性方法,该方法在广泛的时间离散化范围内产生相似性能,并从经验上证实了这种鲁棒性。
引用
@article{arxiv.1901.09732,
title = {Making Deep Q-learning methods robust to time discretization},
author = {Corentin Tallec and Léonard Blier and Yann Ollivier},
journal= {arXiv preprint arXiv:1901.09732},
year = {2019}
}