中文

强化学习中用于神经网络函数逼近的Sigmoid加权线性单元

机器学习 2017-11-03 v3

摘要

近年来,神经网络作为强化学习中的函数逼近器经历了复兴。在 Tesauro 的 TD-Gammon 在西洋双陆棋中取得接近顶级人类水平表现二十年之后,深度强化学习算法 DQN 在许多 Atari 2600 游戏中达到了人类水平表现。本研究的目的是双重的。首先,我们提出两种用于强化学习中神经网络函数逼近的激活函数:sigmoid 加权线性单元(SiLU)及其导数函数(dSiLU)。SiLU 的激活由 sigmoid 函数乘以其输入计算。其次,我们指出,更传统的使用带资格迹的 on-policy 学习(而非经验回放)以及带简单退火 softmax 动作选择的方法,在与 DQN 竞争时无需单独的目标网络。我们验证了所提方法:首先,利用 TD(λ\lambda) 学习和浅层 dSiLU 网络智能体,在随机 SZ-Tetris 和 10×\times10 小棋盘的 Tetris 中均取得新的最先进结果;然后,通过使用带有 SiLU 和 dSiLU 隐藏单元的深层 Sarsa(λ\lambda) 智能体,在 Atari 2600 领域超越 DQN。

关键词

引用

@article{arxiv.1702.03118,
  title  = {Sigmoid-Weighted Linear Units for Neural Network Function Approximation in Reinforcement Learning},
  author = {Stefan Elfwing and Eiji Uchibe and Kenji Doya},
  journal= {arXiv preprint arXiv:1702.03118},
  year   = {2017}
}

备注

18 pages, 22 figures; added deep RL results for SZ-Tetris