中文

策略梯度中探索迷思的背后

机器学习 2025-08-21 v3 机器学习

摘要

为了使用策略梯度算法计算近似最优策略,实践中通常在学习目标中加入内在探索项。尽管这些项的有效性通常由探索环境的内在需求来证明,我们提出了一种基于数值优化视角的新颖分析。我们在学习目标上引入两个准则,在其随机梯度估计上引入另外两个准则,随后用它们来讨论优化后策略的质量。该分析揭示了探索技术的两个独立效应。首先,它们能够平滑学习目标并消除局部最优,同时保留全局最大值。其次,它们修改了梯度估计,提高了随机参数更新最终给出最优策略的概率。我们通过基于熵奖励的探索策略实证地说明了这些效应,指出了其局限性并提出了未来工作的方向。

关键词

引用

@article{arxiv.2402.00162,
  title  = {Behind the Myth of Exploration in Policy Gradients},
  author = {Adrien Bolland and Gaspard Lambrechts and Damien Ernst},
  journal= {arXiv preprint arXiv:2402.00162},
  year   = {2025}
}