连续时间控制中积分强化学习的计算影响
系统与控制
2024-02-28 v1 机器学习
系统与控制
摘要
积分强化学习 (IntRL) 在其策略评估 (PEV) 阶段要求精确计算效用函数的积分。这是通过求积法则实现的,即对从离散时间获得的状态样本所评估的效用函数进行加权求和。我们的研究揭示了一个关键但尚未被充分探索的现象:计算方法的选择(在本例中为求积法则)会显著影响控制性能。这种影响可追溯至 PEV 阶段引入的计算误差会影响策略迭代的收敛行为,进而影响学习到的控制器。为了阐明计算如何影响控制,我们将 IntRL 的策略迭代与应用于 Hamilton-Jacobi-Bellman 方程的牛顿法进行了类比。在此视角下,PEV 中的计算误差表现为牛顿法每次迭代中的一个额外误差项,其上界与计算误差成正比。此外,我们证明了当效用函数位于再生核希尔伯特空间 (RKHS) 时,通过使用带有 RKHS 诱导核函数的贝叶斯求积法可实现最优求积。我们证明了使用梯形法则和使用 Mat\'ern 核的贝叶斯求积法的 IntRL 局部收敛率分别为 和 ,其中 是均匀间隔样本的数量, 是 Mat\'ern 核的光滑性参数。这些理论发现最终通过两个典型控制任务得到了验证。
引用
@article{arxiv.2402.17375,
title = {Impact of Computation in Integral Reinforcement Learning for Continuous-Time Control},
author = {Wenhan Cao and Wei Pan},
journal= {arXiv preprint arXiv:2402.17375},
year = {2024}
}