中文

策略梯度算法中无效动作掩码方法的深入考察

机器学习 2022-06-01 v3 人工智能 机器学习

摘要

近年来,深度强化学习(DRL)算法在许多具有挑战性的策略游戏中取得了最先进的性能。由于这些游戏规则复杂,从所学策略预测的完整离散动作分布中采样的动作很可能依据游戏规则无效(例如走入墙壁)。在策略梯度算法中处理该问题的通常做法是“掩去”无效动作,仅从有效动作集合中采样。然而,这一过程的影响仍未被充分研究。在本文中,我们 1)给出了该做法的理论依据,2)经验性地展示了随着无效动作空间增大其重要性,以及 3)通过评估不同的动作掩码机制(例如在使用掩码训练后移除掩码)提供进一步见解。源代码可在 https://github.com/vwxyzjn/invalid-action-masking 找到。

关键词

引用

@article{arxiv.2006.14171,
  title  = {A Closer Look at Invalid Action Masking in Policy Gradient Algorithms},
  author = {Shengyi Huang and Santiago Ontañón},
  journal= {arXiv preprint arXiv:2006.14171},
  year   = {2022}
}

备注

Accepted into the proceedings of International FLAIRS Conference Proceedings, Vol. 35 (2022)