中文

克服无掩码策略梯度算法中的有效动作抑制问题

机器学习 2026-03-11 v1

摘要

在具有状态依赖动作有效性的强化学习环境中,动作掩码始终优于基于惩罚的无效动作处理方法,但现有理论仅显示掩码可保持策略梯度定理。我们识别了无掩码训练的一种distinct失效模式:它在代理尚未访问的状态下系统性地抑制有效动作。这发生在由于梯度将抑制已访问状态下无效动作的力度,通过共享网络参数传播到那些该动作有效但未被访问的状态。我们证明,对于具有共享特征的softmax策略,当一个动作在已访问的状态下无效但在未访问的状态s*下有效时,由于参数共享和softmax logit的零和恒等式,π(a|s*)的概率受到指数衰减的界限。该界限揭示了熵正则化在保护有效动作与样本效率之间进行权衡,而掩码可消除这种权衡。我们在实证上验证深层网络满足抑制所需的特征对齐条件,Craftax、Craftax-Classic和MiniHack上的实验确认了预测的指数抑制,并表明可行性分类使我们能够在无需oracle掩码的情况下部署。

关键词

引用

@article{arxiv.2603.09090,
  title  = {Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms},
  author = {Renos Zabounidis and Roy Siegelmann and Mohamad Qadri and Woojun Kim and Simon Stepputtis and Katia P. Sycara},
  journal= {arXiv preprint arXiv:2603.09090},
  year   = {2026}
}