中文

基于预测处理近端策略优化的高效深度强化学习

机器学习 2024-01-30 v2 人工智能

摘要

强化学习(RL)的进展往往依赖海量计算资源,并且众所周知的样本效率低下。相比之下,人脑能够利用有限资源高效学习有效的控制策略。这引发了一个问题:神经科学的见解是否可用于改进当前的 RL 方法。预测处理是一个流行的理论框架,认为人脑主动寻求最小化惊奇。我们展示了预测自身感官状态的循环神经网络可用于最小化惊奇,从而在累积奖励上获得显著收益。具体而言,我们提出预测处理近端策略优化(P4O)智能体;一种 actor-critic 强化学习智能体,通过将世界模型集成到其隐藏状态中,将预测处理应用于 PPO 算法的循环变体。即使不进行超参数调优,P4O 在使用单个 GPU 的多个 Atari 游戏上显著优于基线循环变体 PPO 算法。在相同的挂钟时间内,它也优于其他最先进(SOTA)智能体,并在包括 Seaquest 在内的多个游戏上超越人类玩家表现,而 Seaquest 是 Atari 领域中特别具有挑战性的环境。总之,我们的工作强调了神经科学领域的见解如何支持更有能力和更高效的人工智能体的发展。

关键词

引用

@article{arxiv.2211.06236,
  title  = {Efficient Deep Reinforcement Learning with Predictive Processing Proximal Policy Optimization},
  author = {Burcu Küçükoğlu and Walraaf Borkent and Bodo Rueckauer and Nasir Ahmad and Umut Güçlü and Marcel van Gerven},
  journal= {arXiv preprint arXiv:2211.06236},
  year   = {2024}
}

备注

24 pages, 8 figures