中文

强化学习中的 Dropout 策略:限制策略优化方法中替代目标函数的方差

机器学习 2023-11-06 v3

摘要

基于策略的强化学习算法被广泛应用于各个领域。其中,TRPO 和 PPO 等主流策略优化算法将重要性采样引入策略迭代,从而允许历史数据的复用。然而,这也会导致替代目标(surrogate objective)的高方差,并间接影响算法的稳定性和收敛性。在本文中,我们首先推导了替代目标方差的上界,该上界可随替代目标的增长呈二次增长。接下来,我们提出了 dropout 技术,以避免由重要性采样引起的替代目标方差过度增加。然后,我们引入了一个适用于主流策略优化方法的通用强化学习框架,并将 dropout 技术应用于 PPO 算法,得到 D-PPO 变体。最后,我们在 Atari 2600 环境中对 D-PPO 与 PPO 算法进行了对比实验,结果表明 D-PPO 相比 PPO 取得了显著的性能提升,并有效限制了训练过程中替代目标方差的过度增加。

关键词

引用

@article{arxiv.2310.20380,
  title  = {Dropout Strategy in Reinforcement Learning: Limiting the Surrogate Objective Variance in Policy Optimization Methods},
  author = {Zhengpeng Xie and Changdong Yu and Weizheng Qiao},
  journal= {arXiv preprint arXiv:2310.20380},
  year   = {2023}
}