随机与确定性策略梯度的等价性
机器学习
2025-06-11 v2
摘要
连续控制中的策略梯度已分别针对随机策略和确定性策略进行了推导。在此我们研究两者之间的关系。在涉及高斯控制噪声和二次控制代价的常用 MDP 族中,我们证明随机与确定性策略梯度、自然梯度以及状态价值函数是相同的;而状态-控制价值函数则不同。随后,我们开发了一种通用方法,用于构造一个具有确定性策略的 MDP,使其等价于给定的具有随机策略的 MDP。这个新 MDP 的控制量是原 MDP 中随机策略的充分统计量。我们的结果表明,通过近似状态价值函数而非状态-控制价值函数,可以统一策略梯度方法。
引用
@article{arxiv.2505.23244,
title = {Equivalence of stochastic and deterministic policy gradients},
author = {Emo Todorov},
journal= {arXiv preprint arXiv:2505.23244},
year = {2025}
}