通过 Langevin 动力学实现直接软策略抽样
机器学习
2026-02-10 v1 人工智能
摘要
强化学习中的软策略将策略定义为状态-动作价函数的布尔分布,提供了平衡探索与开发的原则机制。然而,在实践中实现此类软策略仍具有挑战性。现有方法要么依赖表达受限的参数化策略,要么采用基于扩散的策略,其不可穿透的似然性阻碍了软策略目标中可靠的熵估计。我们通过由 Q 函数动作梯度驱动的 Langevin 动力学,直接实现软策略抽样。这种视角导致 Langevin Q 学习(LQL),其无需显式参数化策略即可从目标布尔分布中抽样动作。然而,直接应用 Langevin 动力学在高维和非凸 Q 图景中 suffers from slow mixing,限制了其实际有效性。为克服这一问题,我们提出了噪声条件 Langevin Q 学习(NC-LQL),其将多尺度噪声扰动集成到价值函数中。NC-LQL 学习一个噪声条件价值函数,以产生一系列逐渐平滑的价值景观,使抽样能够从全局探索过渡到精确的模式细化。在 OpenAI Gym MuJoCo 基准测试中,NC-LQL 达到了与最先进的基于扩散方法相当的性能,为在线强化学习提供了一个简单而强大的解决方案。
引用
@article{arxiv.2602.07873,
title = {Direct Soft-Policy Sampling via Langevin Dynamics},
author = {Donghyeon Ki and Hee-Jun Ahn and Kyungyoon Kim and Byung-Jun Lee},
journal= {arXiv preprint arXiv:2602.07873},
year = {2026}
}