事后回顾:用于稳定探索的平滑奖励
机器学习
2019-06-25 v1 机器学习
摘要
在经典 Q-learning 中,目标是通过迭代使用 Bellman 方程作为更新来最大化折扣奖励之和,以尝试估计最优策略的动作值函数。通常,损失函数定义为动作值与期望(折扣)奖励之间的时序差分,但它仅关注未来,导致过高估计误差。我们通过引入事后因子来扩展成熟的 Q-learning 技术,该额外损失项通过整合历史时序差分作为奖励的一部分,考量模型的进展过程。这一修正的效果在确定性连续状态空间函数估计问题中得到检验,其中过高估计现象被显著削弱并带来更好的稳定性。事后因子的潜在效应被建模为自适应学习率,与现有自适应优化器不同,它考虑了先前估计的动作值。所提方法优于 Q-learning 的若干变体,具有更高的平均奖励和更低的动作值,这支持了确定性评估,并证明事后因子有助于降低过高估计误差。训练 1000 万帧后 100 回合的平均得分表明,对于多种 ATARI 游戏,事后因子优于深度 Q 网络、双重深度 Q 网络和竞争网络。
引用
@article{arxiv.1906.09781,
title = {In Hindsight: A Smooth Reward for Steady Exploration},
author = {Hadi S. Jomaa and Josif Grabocka and Lars Schmidt-Thieme},
journal= {arXiv preprint arXiv:1906.09781},
year = {2019}
}