Softmax策略梯度方法中的逻辑动态
机器学习
2025-06-17 v1 人工智能
机器学习
摘要
我们分析了softmax策略梯度方法的逻辑动态。我们推导了逻辑更新向量的L2范数确切公式:该公式表明更新幅度由所选动作的概率()和策略的碰撞概率()决定,后者是与熵反比的集中度度量。我们的分析揭示了一种内在的自调节机制,其中学习力度会自动由策略置信度所调制,为这些方法的稳定性和收敛性提供了基础性见解。
关键词
引用
@article{arxiv.2506.12912,
title = {Logit Dynamics in Softmax Policy Gradient Methods},
author = {Yingru Li},
journal= {arXiv preprint arXiv:2506.12912},
year = {2025}
}
备注
7 pages