中文

基于共识的随机控制

最优化与控制 2025-02-03 v2

摘要

我们提出了一种解决高维、有限时滞随机控制问题的梯度-free 深度强化学习算法。虽然最近发展的深度强化学习框架在解决这些问题方面取得了巨大成功,但直接从蒙特卡罗抽样估计策略梯度常常 suffer于高方差。为此,我们引入了动量共识优化 (M-CBO) 和自适应动量共识优化 (Adam-CBO) 框架。这些方法使用价值函数的蒙特卡罗估计,而非其梯度来优化策略。可调的高斯噪声支持高效探索,帮助算法在复杂、非凸环境中收敛到最优策略。数值结果确认了我们方法在各种问题维数上的准确性和可扩展性,并展示了其在均值场控制问题中的潜在扩展。理论上,我们在某些假设下证明了 M-CBO 能收敛到最优策略。

关键词

引用

@article{arxiv.2501.17801,
  title  = {Consensus Based Stochastic Control},
  author = {Liyao Lyu and Jingrun Chen},
  journal= {arXiv preprint arXiv:2501.17801},
  year   = {2025}
}