中文

模仿最优策略:在策略梯度中实现并诱导动作坍缩

机器学习 2025-09-04 v1

摘要

强化学习中的策略梯度 (PG) 方法通常利用深度神经网络 (DNN) 来学习共享的特征表示骨干,用于在动作选择层中计算似然。关于策略网络的收敛性和全局最优性已有大量研究,但鲜有分析这些底层网络的表示结构。在训练最优策略 DNN 时,我们观察到在某些约束条件下,会出现一种类似于神经坍缩的温和结构,我们称之为动作坍缩 (AC)。这表明:1) 共享相同最优动作的状态-动作激活值(即最后一层特征)向这些最优动作各自的平均激活值坍缩;2) 共享相同最优动作的激活值的变异性收敛至零;3) 动作选择层的权重与平均激活值坍缩为一个单纯形等角紧框架 (ETF)。我们早期的工作表明,上述约束对于这些观测是必要的。由于最优策略 DNN 坍缩后的 ETF 在状态-动作空间中最大程度地分离了所有动作的两两夹角,我们自然提出一个问题:能否在动作选择层中使用 ETF 结构作为(固定)目标配置来学习最优策略?我们的解析证明表明,使用固定 ETF 作为动作选择层来学习激活值自然会导致 AC。因此,我们提出了动作坍缩策略梯度 (ACPG) 方法,相应地在动作选择层附加一个合成 ETF。ACPG 诱导策略 DNN 在动作选择层中产生这种理想配置,同时保持最优。我们在各种 OpenAI Gym 环境中的实验表明,我们的技术可以集成到任何离散 PG 方法中,并能更快速、更稳健地带来有利的奖励提升。

关键词

引用

@article{arxiv.2509.02737,
  title  = {Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient},
  author = {Zhongzhu Zhou and Yibo Yang and Ziyan Chen and Fengxiang Bie and Haojun Xia and Xiaoxia Wu and Robert Wu and Ben Athiwaratkun and Bernard Ghanem and Shuaiwen Leon Song},
  journal= {arXiv preprint arXiv:2509.02737},
  year   = {2025}
}

备注

18 pages, 4 figures, 2 tables; includes supplementary material; preprint