面向策略梯度强化学习的一致 Dropout
机器学习
2022-02-25 v1 人工智能
摘要
Dropout 长期以来是监督学习的标配,却很少用于强化学习。我们分析了朴素应用 dropout 对策略梯度学习算法存在的问题,并引入一致 dropout(consistent dropout),一种解决该不稳定性的简单技术。我们证明一致 dropout 能在连续与离散动作环境中,于广泛 dropout 概率范围内实现 A2C 与 PPO 的稳定训练。最后,我们展示一致 dropout 能够在线训练诸如 GPT 的复杂架构,而无需禁用模型原生的 dropout。
引用
@article{arxiv.2202.11818,
title = {Consistent Dropout for Policy Gradient Reinforcement Learning},
author = {Matthew Hausknecht and Nolan Wagener},
journal= {arXiv preprint arXiv:2202.11818},
year = {2022}
}