深度强化学习的信息论最优性原理
人工智能
2018-11-21 v5 机器学习
机器学习
摘要
我们方法论地解决了深度强化学习中 Q 值高估的问题,以高效处理高维状态空间。通过借鉴信息论概念,我们引入了一种内在惩罚信号,鼓励降低 Q 值估计。所得算法涵盖了广泛的学習结果,其中深度 Q 网络 (deep Q-networks) 作为一个特例。通过相应地调整拉格朗日乘子,可以展示不同的学习结果。此外,我们提出了一种针对该拉格朗日乘子的新颖调度方案,以确保高效且稳健的学习。在 Atari 游戏实验中,我们的算法在游戏表现和样本复杂度方面均优于其他算法(例如深度 Q 网络和双重深度 Q 网络)。这些结果在最近提出的 Dueling 架构下依然有效。
引用
@article{arxiv.1708.01867,
title = {An Information-Theoretic Optimality Principle for Deep Reinforcement Learning},
author = {Felix Leibfried and Jordi Grau-Moya and Haitham Bou-Ammar},
journal= {arXiv preprint arXiv:1708.01867},
year = {2018}
}
备注
Presented at the NIPS Deep Reinforcement Learning Workshop, Montreal, Canada, 2018