中文

基于新颖性演化策略的强化学习中 Transformer 训练

机器学习 2025-09-18 v2 神经与进化计算

摘要

本文实验了基于新颖性的 OpenAI-ES 的变体,即 NS-ES 和 NSR-ES 算法,并评估了其在训练用于强化学习问题(如 Decision Transformer)的复杂 Transformer 架构中的有效性。我们还测试了通过用预训练模型初始化来加速这些大型模型的新颖性训练。实验结果 Mixed。NS-ES 取得了进展,但显然需要更多迭代才能产生有趣的智能体。相比之下,NSR-ES 证明能够直接应用于大型模型,由于其性能在前馈模型和 Decision Transformer 之间保持一致,类似于我们之前工作中的 OpenAI-ES。

关键词

引用

@article{arxiv.2502.06301,
  title  = {Utilizing Novelty-based Evolution Strategies to Train Transformers in Reinforcement Learning},
  author = {Matyáš Lorenc and Roman Neruda},
  journal= {arXiv preprint arXiv:2502.06301},
  year   = {2025}
}