中文

利用演化策略训练基于强化学习中的 Transformer 智能体

机器学习 2025-07-31 v2 神经与进化计算

摘要

我们探索了利用演化策略训练基于 Transformer 架构的智能体在强化学习环境中的能力。我们使用 OpenAI 的高度可并行化演化策略,在 MuJoCo Humanoid locomotion 环境和 Atari 游戏环境中训练 Decision Transformer,测试了这种黑箱优化技术是否能够训练相对较大且结构复杂的模型(与文献中之前测试的模型相比)。所检验的演化策略总体上能够实现优异成绩,成功产生了高性能智能体,展示了演化技术在训练如此复杂模型方面的潜力。

关键词

引用

@article{arxiv.2501.13883,
  title  = {Utilizing Evolution Strategies to Train Transformers in Reinforcement Learning},
  author = {Matyáš Lorenc and Roman Neruda},
  journal= {arXiv preprint arXiv:2501.13883},
  year   = {2025}
}