中文

基于动态 Boltzmann Softmax 更新的强化学习

机器学习 2019-09-10 v4 人工智能 机器学习

摘要

价值函数估计是强化学习中的一项重要任务,即预测。Boltzmann softmax 算子是一种自然的价值估计量,并可带来若干益处。然而,它不满足非扩张性质,即便在值迭代中直接使用也可能无法收敛。本文提出以动态 Boltzmann softmax(DBS)算子更新价值函数,该算子在规划与学习设定下具有良好的收敛性质。GridWorld 上的实验结果表明,DBS 算子能够实现更好的价值函数估计,从而纠正 softmax 算子的收敛问题。最后,我们将动态 Boltzmann softmax 更新应用于深度 Q 网络,提出 DBS-DQN 算法,其在 49 个 Atari 游戏中的 40 个上大幅优于 DQN。

关键词

引用

@article{arxiv.1903.05926,
  title  = {Reinforcement Learning with Dynamic Boltzmann Softmax Updates},
  author = {Ling Pan and Qingpeng Cai and Qi Meng and Wei Chen and Longbo Huang and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1903.05926},
  year   = {2019}
}