深度强化学习中目标网络的 t-软更新
机器学习
2021-01-12 v2 机器学习
摘要
本文提出一种用于深度强化学习(DRL)目标网络的新鲁棒更新规则,以替代传统的作为指数移动平均的更新规则。目标网络用于在 DRL 中为main网络平滑生成参考信号,从而降低学习方差。其传统更新规则的问题在于,所有参数都以相同速度从主网络平滑复制,即便其中部分正试图向错误方向更新。该行为增加了生成错误参考信号的风险。尽管整体放慢更新速度是缓解错误更新的朴素方法,却会降低学习速度。为在保持学习速度的同时鲁棒更新参数,受学生-t 分布启发,参照指数移动平均与正态分布的类比,推导出一种 t-软更新方法。通过对导出的 t-软更新的分析,我们表明其继承了学生-t 分布的性质。具体而言,借助学生-t 分布的重尾性质,t-软更新自动排除不同于过往经验的极端更新。此外,当更新类似于过往经验时,它可通过增大更新量来缓解学习延迟。在 PyBullet 机器人 DRL 仿真中,采用 t-软更新的在线 actor-critic 算法在所获回报和/或其方差方面优于传统方法。从 t-软更新的训练过程,我们发现 t-软更新与标准软更新全局一致,且更新率在局部被调整以加速或抑制。
引用
@article{arxiv.2008.10861,
title = {t-Soft Update of Target Network for Deep Reinforcement Learning},
author = {Taisuke Kobayashi and Wendyam Eric Lionel Ilboudo},
journal= {arXiv preprint arXiv:2008.10861},
year = {2021}
}
备注
11 pages, 7 figures