时变环境下的学习控制
机器学习
2022-06-07 v1 系统与控制
系统与控制
摘要
本文研究线性时变(LTV)动力系统中的后悔最小化问题。由于不确定性与非平稳性同时存在,为未知 LTV 系统设计在线控制算法仍是一项挑战。在以 NP 困难离线规划为代价的前提下,已有工作引入了在线凸优化算法,尽管它们承受非参数的后悔率。本文提出首个计算上易处理的、具有后悔保证且避免对状态线性反馈策略进行离线规划的在线算法。我们的算法基于面对不确定性的乐观(OFU)原理,在该原理中我们乐观地在高置信区域内选择最佳模型。与先前方法相比,我们的算法更具探索性。为克服非平稳性,我们提出重启策略(R-OFU)或滑动窗口(SW-OFU)策略。在适当配置下,我们的算法达到次线性后悔 。这些算法利用当前阶段的数据来跟踪系统动力学的变化。我们通过数值实验证实了理论发现,突出了方法的有效性。据我们所知,我们的研究建立了首个在 LTV 动力系统下具有后悔保证的基于模型的在线算法。
引用
@article{arxiv.2206.02507,
title = {Learning to Control under Time-Varying Environment},
author = {Yuzhen Han and Ruben Solozabal and Jing Dong and Xingyu Zhou and Martin Takac and Bin Gu},
journal= {arXiv preprint arXiv:2206.02507},
year = {2022}
}