中文

基于策略梯度方法的未知线性开关系统自适应控制

机器学习 2026-01-07 v1 人工智能

摘要

我们考虑策略梯度自适应控制 (PGAC) 框架,该框架通过对线性二次型控制器代价进行数据驱动的梯度下降步骤来实时更新控制策略。该方法在实践中已显示出对模型参数和开关时间均未知的情况下的适应性。为形式化这一观察,我们设计了一种 PGAC 方法,用于稳定线性开关系统,其中模型参数和开关时间均为未知。我们采用滑动窗口数据进行策略梯度估计,并指出在满足滞后时间条件且动态变化较小的前提下,策略能够跟踪开关动态并确保闭环稳定。我们进行仿真实验以验证理论结果。

关键词

引用

@article{arxiv.2601.03015,
  title  = {In-Context Reinforcement Learning through Bayesian Fusion of Context and Value Prior},
  author = {Anaïs Berkes and Vincent Taboga and Donna Vakalis and David Rolnick and Yoshua Bengio},
  journal= {arXiv preprint arXiv:2601.03015},
  year   = {2026}
}