基于动态 Boltzmann Softmax 更新的强化学习
机器学习
2019-09-10 v4 人工智能
机器学习
摘要
价值函数估计是强化学习中的一项重要任务,即预测。Boltzmann softmax 算子是一种自然的价值估计量,并可带来若干益处。然而,它不满足非扩张性质,即便在值迭代中直接使用也可能无法收敛。本文提出以动态 Boltzmann softmax(DBS)算子更新价值函数,该算子在规划与学习设定下具有良好的收敛性质。GridWorld 上的实验结果表明,DBS 算子能够实现更好的价值函数估计,从而纠正 softmax 算子的收敛问题。最后,我们将动态 Boltzmann softmax 更新应用于深度 Q 网络,提出 DBS-DQN 算法,其在 49 个 Atari 游戏中的 40 个上大幅优于 DQN。
引用
@article{arxiv.1903.05926,
title = {Reinforcement Learning with Dynamic Boltzmann Softmax Updates},
author = {Ling Pan and Qingpeng Cai and Qi Meng and Wei Chen and Longbo Huang and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1903.05926},
year = {2019}
}