中文

基于高斯平滑的软确定性策略梯度

机器学习 2026-05-08 v1 人工智能

摘要

确定性策略梯度(DPG)被广泛用于连续控制;然而,它本质上依赖于在策略更新期间评论家关于动作的可微性。在涉及稀疏或离散奖励的实际控制问题中,这一假设不成立,导致策略梯度定义不明和学习不稳定。为了应对这些挑战,我们提出了一种基于通过高斯平滑构建的平滑Bellman方程的原则性替代方案。具体而言,我们基于平滑Bellman方程定义了一个新颖的动作值函数,并推导了软确定性策略梯度。我们的公式消除了对评论家动作梯度的显式依赖,并确保即使对于非平滑Q函数,梯度依然定义良好。我们将此框架实例化为一种深度强化学习算法,称之为软深度确定性策略梯度。在标准连续控制基准及其离散化奖励变体上的实证评估表明,Soft DDPG在密集奖励环境中保持竞争力,并在大多数离散化奖励环境中提供了明显的收益,而标准DDPG在这些环境中对不规则的评论家景观更为敏感。

关键词

引用

@article{arxiv.2605.06228,
  title  = {Soft Deterministic Policy Gradient with Gaussian Smoothing},
  author = {Hyunjun Na and Donghwan Lee},
  journal= {arXiv preprint arXiv:2605.06228},
  year   = {2026}
}

备注

25 pages, 4 figures