中文

带梯度不确定性的鲁棒控制

机器学习 2025-07-22 v1 人工智能 最优化与控制

摘要

我们提出了鲁棒控制理论的一种新扩展,显式地处理价函数梯度的不确定性,这种不确定性深植于诸如强化学习等应用领域,因价值函数常被近似。我们构建了一个零和动态博弈, adversary 对系统动力学和价函数梯度都进行扰动,导致一个新的高度非线性偏微分方程:带梯度不确定性的哈蒙-贾比尔-班奇尔斯方程 (Gradient-Uncertainty-Robust HJBI, GU-HJBI)。我们通过在均匀 ellipticity 条件下证明其粘性解的对比原理来建立其良定性。我们对线性-二次 (LQ) 情形进行分析,获得关键洞见:我们证明了对于任意非零梯度不确定性,经典的二次价函数假设都不成立,从而根本性地改变了问题结构。形式化的扰动分析刻画了价函数的非多项式修正以及最优控制律的 resulting nonlinearity,我们通过数值研究予以验证。最后,我们通过提出一种新的梯度不确定性鲁棒演员-评论家算法 (Gradient-Uncertainty-Robust Actor-Critic, GURAC),并进行经empirical 研究,展示了其在稳定训练方面的有效性。这一工作为鲁棒控制提供了新的方向,对那些常涉及函数近似的领域具有重大意义,包括强化学习和计算金融。

关键词

引用

@article{arxiv.2507.15082,
  title  = {Robust Control with Gradient Uncertainty},
  author = {Qian Qi},
  journal= {arXiv preprint arXiv:2507.15082},
  year   = {2025}
}