中文

使深度 Q-learning 方法对时间离散化具有鲁棒性

机器学习 2019-01-30 v2 机器学习

摘要

尽管取得了显著成功,深度强化学习(DRL)对超参数化、实现细节或微小环境变化并不鲁棒(Henderson et al. 2017, Zhang et al. 2018)。克服这种敏感性是使 DRL 适用于现实世界问题的关键。在本文中,我们确定近连续时间环境中对时间离散化的敏感性为一个关键因素;这涵盖了例如改变每秒帧数或控制器的动作频率。经验上,我们发现基于 Q-learning 的方法如 Deep Q-learning(Mnih et al., 2015)和 Deep Deterministic Policy Gradient(Lillicrap et al., 2015)在较小时间步下会崩溃。形式上,我们证明 Q-learning 在连续时间中不存在。我们详述了一种构建离策略 RL 算法的原则性方法,该方法在广泛的时间离散化范围内产生相似性能,并从经验上证实了这种鲁棒性。

关键词

引用

@article{arxiv.1901.09732,
  title  = {Making Deep Q-learning methods robust to time discretization},
  author = {Corentin Tallec and Léonard Blier and Yann Ollivier},
  journal= {arXiv preprint arXiv:1901.09732},
  year   = {2019}
}