循环近端策略优化中的泛化、混乱环境与局限性
机器学习
2022-05-24 v1
摘要
初看起来,在深度强化学习算法中使用循环层以使智能体在部分可观测环境中利用记忆似乎是直截了当的。从广泛使用的近端策略优化(PPO)出发,我们强调了在添加循环结构以实现正确且高效实现时必须做对的若干关键细节,即:正确构造神经网络的前向传播、安排训练数据、相应地为序列起始选择隐藏状态以及为损失计算屏蔽填充。我们进一步通过所贡献的新环境 Mortar Mayhem 和 Searing Spotlights 来探索循环 PPO 的局限性,这些环境对智能体记忆的挑战超越了单纯的容量与干扰任务。值得注意的是,我们可以证明在 Mortar Mayhem 中当扩大训练种子数量时会出现向强泛化的转变,而智能体在 Searing Spotlights 上未能成功,这似乎是面向基于记忆的智能体的一项艰巨挑战。
引用
@article{arxiv.2205.11104,
title = {Generalization, Mayhems and Limits in Recurrent Proximal Policy Optimization},
author = {Marco Pleines and Matthias Pallasch and Frank Zimmer and Mike Preuss},
journal= {arXiv preprint arXiv:2205.11104},
year = {2022}
}
备注
17 pages, 18 figures, preprint