中文

基于有界极值寻求的深度强化学习控制时变系统鲁棒性提升

机器学习 2026-03-11 v2 系统与控制 系统与控制

摘要

本文研究在深度强化学习 (DRL) 控制一类非线性时变系统的鲁棒性方面,如何采用基于有界极值寻求 (bounded extremum seeking, ES) 的模型独立鲁棒反馈控制方法。DRL 能够从大规模数据集中快速学习,以控制或优化众多参数系统的输出,但当系统模型随时间快速变化时,其性能会灾难性下降。有界 ES 能处理控制方向未知的时变系统,但随参数调优数量增加,收敛速度会减慢;且作为所有局部自适应方法,可能陷入局部极小值。我们展示,DRL 与有界 ES 组合后形成的混合控制器性能超过各自单独作用,DRL 利用历史数据快速学习控制众多参数系统至预期设定点,而有界 ES 确保其对时变性的鲁棒性。我们present了一般时变系统的数值研究,以及一种用于 Los Alamos 中子科学中心线性粒子加速器低能束输运部分(Low Energy Beam Transport section)的组合 ES-DRL 控制器的自动调参。

关键词

引用

@article{arxiv.2510.02490,
  title  = {Improved Robustness of Deep Reinforcement Learning for Control of Time-Varying Systems by Bounded Extremum Seeking},
  author = {Shaifalee Saxena and Alan Williams and Rafael Fierro and Alexander Scheinker},
  journal= {arXiv preprint arXiv:2510.02490},
  year   = {2026}
}