中文

作为变动作环境策略的 Transformer

人工智能 2023-01-11 v1 机器学习

摘要

在本项目中,我们展示了 transformer 编码器作为变动作环境中策略的可行架构的有效性。利用它,我们在 Gym-μ\muRTS 环境中针对脚本对手在多个地图上使用近端策略优化(PPO)训练智能体。最终智能体以仅为此前最佳 RL 智能体(使用 GridNet 架构)一半的计算资源取得了更高的回报。源代码与预训练模型可在此处获取:https://github.com/NiklasZ/transformers-for-variable-action-envs

关键词

引用

@article{arxiv.2301.03679,
  title  = {Transformers as Policies for Variable Action Environments},
  author = {Niklas Zwingenberger},
  journal= {arXiv preprint arXiv:2301.03679},
  year   = {2023}
}

备注

Accepted to AAAI Conference for Artificial Intelligence for Interactive Digital Entertainment (AIIDE) 2022 Workshop