中文

Softmax策略梯度方法中的逻辑动态

机器学习 2025-06-17 v1 人工智能 机器学习

摘要

我们分析了softmax策略梯度方法的逻辑动态。我们推导了逻辑更新向量的L2范数确切公式:Δz212Pc+C(P) \|\Delta \mathbf{z}\|_2 \propto \sqrt{1-2P_c + C(P)} 该公式表明更新幅度由所选动作的概率(PcP_c)和策略的碰撞概率(C(P)C(P))决定,后者是与熵反比的集中度度量。我们的分析揭示了一种内在的自调节机制,其中学习力度会自动由策略置信度所调制,为这些方法的稳定性和收敛性提供了基础性见解。

关键词

引用

@article{arxiv.2506.12912,
  title  = {Logit Dynamics in Softmax Policy Gradient Methods},
  author = {Yingru Li},
  journal= {arXiv preprint arXiv:2506.12912},
  year   = {2025}
}

备注

7 pages