作为变动作环境策略的 Transformer
人工智能
2023-01-11 v1 机器学习
摘要
在本项目中,我们展示了 transformer 编码器作为变动作环境中策略的可行架构的有效性。利用它,我们在 Gym-RTS 环境中针对脚本对手在多个地图上使用近端策略优化(PPO)训练智能体。最终智能体以仅为此前最佳 RL 智能体(使用 GridNet 架构)一半的计算资源取得了更高的回报。源代码与预训练模型可在此处获取:https://github.com/NiklasZ/transformers-for-variable-action-envs
引用
@article{arxiv.2301.03679,
title = {Transformers as Policies for Variable Action Environments},
author = {Niklas Zwingenberger},
journal= {arXiv preprint arXiv:2301.03679},
year = {2023}
}
备注
Accepted to AAAI Conference for Artificial Intelligence for Interactive Digital Entertainment (AIIDE) 2022 Workshop