中文

探索强化学习中循环神经网络的动作编码方式

机器学习 2026-05-19 v1

摘要

构建和维护状态以学习策略和价值函数是将强化学习 (RL) 智能体部署到现实世界的关键任务。循环神经网络 (RNN) 已成为解决状态构建问题的关键研究方向,许多大型强化学习智能体都纳入了循环网络。尽管 RNN 在许多 RL 应用中已成为主流,但许多负责性能提升的关键设计选择和实现细节往往未被报道。本文探讨了 RNN 架构在 RL 中可进行修改的一个维度,具体而言是如何将动作信息融入循环单元的状态更新函数中。我们讨论了几种使用动作信息的方法,并在一组示范性领域中对所需架构进行经验评估。最后,我们讨论了在 RL 环境中开发循环单元的未来工作及其特定挑战。

关键词

引用

@article{arxiv.2605.16318,
  title  = {Investigating Action Encodings in Recurrent Neural Networks in Reinforcement Learning},
  author = {Matthew Schlegel and Volodymyr Tkachuk and Adam White and Martha White},
  journal= {arXiv preprint arXiv:2605.16318},
  year   = {2026}
}

备注

Published in TMLR in 2023, https: // openreview. net/ forum? id= K6g4MbAC1r .Transactions on Machine Learning Research (2023)