中文

关于丢包和不确定性下线性系统强化学习与自适应控制的比较

系统与控制 2026-06-30 v1

摘要

本文对具有输入量化的不确定线性系统在通信信道遭受丢包的情况下,自适应量化控制(AQC)和深度确定性策略梯度(DDPG)强化学习进行了比较研究。所考虑的设置还包括在运行期间从标称不稳定系统动态切换到更不稳定的系统。AQC针对未知系统动力学设计,使用确认消息来补偿丢包,而DDPG控制器使用标称系统模型训练,不使用确认消息。数值结果表明,DDPG控制器在其训练环境中实现了更快的瞬态响应和改进的阻尼。然而,在模型不确定性、丢包和动态切换下,AQC由于其严格的Lyapunov稳定性保证而始终表现出优越的鲁棒性。这些结果凸显了数据驱动性能与基于模型的鲁棒性之间的权衡,并为强化学习和自适应控制在网络化不确定系统中的应用提供了见解。

关键词

引用

@article{arxiv.2606.32003,
  title  = {On the Comparison of Reinforcement Learning and Adaptive Control for Linear Systems under Packet Loss and Uncertainty},
  author = {Moh Kamalul Wafi},
  journal= {arXiv preprint arXiv:2606.32003},
  year   = {2026}
}

备注

Extended and revised version of the paper published in the Proceedings of the SIAM Conference on Control and Its Applications (CT23). doi.org/10.1137/1.9781611977745