中文

具有乘性噪声的离散时间随机系统基于学习的原始-对偶最优控制

最优化与控制 2025-06-04 v1

摘要

强化学习 (RL) 是在不知道系统模型精确信息的情况下解决最优控制问题的有效方法。然而,经典的 Q-learning 方法作为一种无模型 RL 算法,存在缺乏严格理论分析以及在实现过程中需要人工扰动等局限性。本文从原始-对偶视角探讨了具有乘性噪声系统的部分无模型随机线性二次调节器 (SLQR) 问题,以应对这些挑战。该方法为理解经典 RL 算法的内在机制奠定了坚实的理论基础。我们将 SLQR 重新表述为非凸原始-对偶优化问题,并推导出强对偶结果,这使我们能够基于 Karush-Kuhn-Tucker (KKT) 条件为 SLQR 最优策略设计提供基于模型和无模型的算法。一个说明性示例展示了所提出的无模型算法的有效性,揭示了人类手臂运动中中枢神经系统的学习机制。

关键词

引用

@article{arxiv.2506.02613,
  title  = {Learning-based primal-dual optimal control of discrete-time stochastic systems with multiplicative noise},
  author = {Xiushan Jiang and Weihai Zhang},
  journal= {arXiv preprint arXiv:2506.02613},
  year   = {2025}
}