中文

在强化学习与随机控制中统一离散时间混合策略与连续时间放松控制

最优化与控制 2025-11-17 v2

摘要

强化学习(RL)是当前优化动力学系统最突出的方法之一,已在诸多领域取得突破性成果。该框架基于马尔可夫决策过程(MDP)的概念,导致离散时间最优控制问题。在RL文献中,这类问题通常采用混合策略进行形式化和求解,随后在每个时间步骤中抽样随机动作。最近,部分最优控制社区开始研究RL算法的连续时间版本,用由放松控制支配的连续时间随机过程取代MDP,断言两种表述之间存在完全的类比。在本文中,我们检视了这种类比的局限性,并在仅控制连续时间模型漂移项的情况下,对两种问题之间建立严格的联系。我们证明了当时间离散化网格趋于零时,混合策略的RL实现具有强收敛性。我们也讨论了控制扩散分量可能存在的技术挑战。

关键词

引用

@article{arxiv.2504.21793,
  title  = {Reconciling Discrete-Time Mixed Policies and Continuous-Time Relaxed Controls in Reinforcement Learning and Stochastic Control},
  author = {Rene Carmona and Mathieu Lauriere},
  journal= {arXiv preprint arXiv:2504.21793},
  year   = {2025}
}

备注

14 pages