离散采样随机策略在连续时间强化学习中的准确性
机器学习
2025-10-03 v2 数值分析
数值分析
最优化与控制
摘要
随机策略(也称为松弛控制)在连续时间强化学习算法中广泛应用。然而,在连续时间环境中执行随机策略并评估其性能仍是开放挑战。本工作引入并严格分析了一个策略执行框架,该框架在离散时间点从随机策略采样动作,并将其实现为分段常数控制。我们证明,当采样网格大小趋于零时,受控状态过程在分布上收敛于具有根据随机策略聚合系数的动力学。我们根据系数的规整性显式量化收敛速率,并为足够规整的系数建立最优的一阶收敛速率。此外,我们证明了一个1/2阶的弱收敛速率,可在高概率下对采样噪声统一成立,并在无波动率控制的情况下,对每个系统噪声实现1/2阶的路径一致收敛。基于这些结果,我们分析了基于离散时间观测的各种策略评估和策略梯度估计器的偏差和方差。我们的结果为[H. Wang, T. Zariphopoulou, 和 X.Y. Zhou, J. Mach. Learn. Res., 21 (2020), pp. 1-34]中的探索性随机控制框架提供了理论依据。
引用
@article{arxiv.2503.09981,
title = {Accuracy of Discretely Sampled Stochastic Policies in Continuous-time Reinforcement Learning},
author = {Yanwei Jia and Du Ouyang and Yufei Zhang},
journal= {arXiv preprint arXiv:2503.09981},
year = {2025}
}