中文

连续时间控制中积分强化学习的计算影响

系统与控制 2024-02-28 v1 机器学习 系统与控制

摘要

积分强化学习 (IntRL) 在其策略评估 (PEV) 阶段要求精确计算效用函数的积分。这是通过求积法则实现的,即对从离散时间获得的状态样本所评估的效用函数进行加权求和。我们的研究揭示了一个关键但尚未被充分探索的现象:计算方法的选择(在本例中为求积法则)会显著影响控制性能。这种影响可追溯至 PEV 阶段引入的计算误差会影响策略迭代的收敛行为,进而影响学习到的控制器。为了阐明计算如何影响控制,我们将 IntRL 的策略迭代与应用于 Hamilton-Jacobi-Bellman 方程的牛顿法进行了类比。在此视角下,PEV 中的计算误差表现为牛顿法每次迭代中的一个额外误差项,其上界与计算误差成正比。此外,我们证明了当效用函数位于再生核希尔伯特空间 (RKHS) 时,通过使用带有 RKHS 诱导核函数的贝叶斯求积法可实现最优求积。我们证明了使用梯形法则和使用 Mat\'ern 核的贝叶斯求积法的 IntRL 局部收敛率分别为 O(N2)O(N^{-2})O(Nb)O(N^{-b}),其中 NN 是均匀间隔样本的数量,bb 是 Mat\'ern 核的光滑性参数。这些理论发现最终通过两个典型控制任务得到了验证。

关键词

引用

@article{arxiv.2402.17375,
  title  = {Impact of Computation in Integral Reinforcement Learning for Continuous-Time Control},
  author = {Wenhan Cao and Wei Pan},
  journal= {arXiv preprint arXiv:2402.17375},
  year   = {2024}
}