用有效视野桥接强化学习理论与实践
机器学习
2024-01-15 v3 机器学习
摘要
深度强化学习(RL)在某些环境中表现惊人,而在其他环境中却灾难性地失败。理想情况下,RL理论应能提供对此的理解,即预测实际性能的界。遗憾的是,当前理论尚不完全具备这种能力。我们通过引入一个新数据集BRIDGE,将标准深度RL算法与先前的样本复杂度界进行比较。它由来自常见深度RL基准的155个确定性MDP及其对应的表格表示组成,使我们能够精确计算依赖于实例的界。我们选择关注确定性环境,因为它们具有随机环境的许多有趣特性,但更易于分析。使用BRIDGE,我们发现先前的界与深度RL成功与否的相关性不佳,但发现了一种具有相关性的令人惊讶的性质。当随机策略下Q值最高的动作在最优策略下也具有最高Q值(即当在随机策略的Q函数上贪心是最优的)时,深度RL往往成功;否则往往失败。我们将此性质推广为一种称为有效视野的MDP新复杂度度量,它大致对应于在该MDP中为了识别下一个最优动作所需的向前搜索步数,其中叶节点用随机rollout评估。使用BRIDGE,我们表明基于有效视野的界比先前的样本复杂度界在四个指标上更能反映PPO和DQN的经验性能。我们还发现,与现有界不同,有效视野可以预测使用奖励塑形或预训练探索策略的效果。我们的代码和数据可在 https://github.com/cassidylaidlaw/effective-horizon 获取。
引用
@article{arxiv.2304.09853,
title = {Bridging RL Theory and Practice with the Effective Horizon},
author = {Cassidy Laidlaw and Stuart Russell and Anca Dragan},
journal= {arXiv preprint arXiv:2304.09853},
year = {2024}
}