利用演化策略训练基于强化学习中的 Transformer 智能体
机器学习
2025-07-31 v2 神经与进化计算
摘要
我们探索了利用演化策略训练基于 Transformer 架构的智能体在强化学习环境中的能力。我们使用 OpenAI 的高度可并行化演化策略,在 MuJoCo Humanoid locomotion 环境和 Atari 游戏环境中训练 Decision Transformer,测试了这种黑箱优化技术是否能够训练相对较大且结构复杂的模型(与文献中之前测试的模型相比)。所检验的演化策略总体上能够实现优异成绩,成功产生了高性能智能体,展示了演化技术在训练如此复杂模型方面的潜力。
引用
@article{arxiv.2501.13883,
title = {Utilizing Evolution Strategies to Train Transformers in Reinforcement Learning},
author = {Matyáš Lorenc and Roman Neruda},
journal= {arXiv preprint arXiv:2501.13883},
year = {2025}
}