中文

RLBenchNet: 为特定强化学习任务选择合适的网络

机器学习 2025-05-22 v1

摘要

强化学习 (Reinforcement Learning, RL) 通过应用各种神经网络架构实现了显著进展。本研究系统性地调查了在 RL 任务中几种神经网络的性能,包括长短期记忆网络 (Long Short-Term Memory, LSTM)、多层感知器 (Multi-Layer Perceptron, MLP)、Mamba/Mamba-2、Transformer-XL、Gated Transformer-XL 和门控循环单元 (Gated Recurrent Unit, GRU)。通过在连续控制、离散决策和记忆驱动环境中的全面评估,我们识别出特定架构的优势与局限性。我们的结果揭示了: (1) 在完全可观测的连续控制任务中,MLP 在性能和效率之间提供了最佳平衡; (2) 像 LSTM 和 GRU 这样的循环架构在部分可观测环境中表现稳健,要求适中记忆; (3) Mamba 模型相较于 LSTM 吞吐量提高 4.5 倍,相较于 GRU 提升 3.9 倍,同时保持可比性能; (4) 只有 Transformer-XL、Gated Transformer-XL 和 Mamba-2 能够解决最具挑战性的记忆密集型任务,其中 Mamba-2 比 Transformer-XL 需要 8 倍更少的内存。这些发现为研究人员和实践者提供了洞见,使他们能够根据特定任务特征和计算约束进行更有信息的架构选择。代码已公开:https://github.com/SafeRL-Lab/RLBenchNet

关键词

引用

@article{arxiv.2505.15040,
  title  = {RLBenchNet: The Right Network for the Right Reinforcement Learning Task},
  author = {Ivan Smirnov and Shangding Gu},
  journal= {arXiv preprint arXiv:2505.15040},
  year   = {2025}
}