具有可证明后悔保证的在线滚动时域学习控制的探索平衡
最优化与控制
2022-11-02 v9 系统与控制
系统与控制
摘要
我们解决在线滚动时域控制设定中同时学习与控制的问题。我们考虑在一般代价函数和关于控制输入的仿射约束下,对未知线性动态系统的控制。我们的目标是开发一种在线学习算法以最小化动态后悔,其定义为算法产生的累积代价与具有系统和代价函数及状态完全信息且满足控制输入约束的最优策略的累积代价之差。我们提出一种在在线滚动时域设定中进行探索的新方法。关键挑战在于确保滚动时域控制器生成的控制具有持续激励性。我们的方法是对滚动时域控制器生成的控制输入施加扰动,以平衡探索-利用权衡。通过探索保证次线性后悔的条件,我们证明当控制器对代价函数具有从一个区间到下一区间尺寸加倍的预览时,所提控制器的后悔和累积约束违反的性能上界均为。
引用
@article{arxiv.2010.07269,
title = {Balancing Exploration for Online Receding Horizon Learning Control with Provable Regret Guarantees},
author = {Deepan Muthirayan and Jianjun Yuan and Pramod P. Khargonekar},
journal= {arXiv preprint arXiv:2010.07269},
year = {2022}
}
备注
The proof of the method in this paper is incorrect. The correct method, which is different from this paper is given in "online learning for predictive control with provable regret guarantees": arXiv:2111.15041