中文

用于线性二次系统自适应控制的增广 RBMLE-UCB 方法

最优化与控制 2023-03-27 v2 机器学习 系统与控制 系统与控制

摘要

我们考虑控制具有二次代价的未知随机线性系统的问题——称为自适应 LQ 控制问题。我们重新审视了四十多年前提出的称为“奖励偏置最大似然估计”(RBMLE)的方法,它早于“上置信界”(UCB)方法以及 bandit 问题“regret(后悔)”的定义。它仅仅在参数估计准则中增加了一个偏好具有更大奖励参数的项。我们展示了 RBMLE 与 UCB 方法如何调和,从而提出一种增广 RBMLE-UCB 算法,该算法将 RBMLE 方法的惩罚与 UCB 方法的约束结合,在不确定性面前统一了两种乐观主义方法。我们确立理论上该方法保持 \TildeO(T)\Tilde{\mathcal{O}}(\sqrt{T}) regret,即迄今已知最优。我们进一步在包括波音 747 与无人机的飞行控制在内的许多真实世界例子上,比较了所提增广 RBMLE-UCB 与标准 RBMLE(无增广)同 UCB、Thompson Sampling、Input Perturbation、Randomized Certainty Equivalence 与 StabL 的经验性能。我们进行了广泛的仿真研究,表明增广 RBMLE 以巨大优势持续优于 UCB、Thompson Sampling 与 StabL,同时略优于 Input Perturbation,中等程度优于 Randomized Certainty Equivalence。

关键词

引用

@article{arxiv.2201.10542,
  title  = {Augmented RBMLE-UCB Approach for Adaptive Control of Linear Quadratic Systems},
  author = {Akshay Mete and Rahul Singh and P. R. Kumar},
  journal= {arXiv preprint arXiv:2201.10542},
  year   = {2023}
}

备注

36th Conference on Neural Information Processing Systems (NeurIPS 2022). https://openreview.net/forum?id=7pNV4PCjbQy