具有部分未知代价函数的基于学习 MPC 的遗憾分析
最优化与控制
2023-01-30 v2 机器学习
摘要
探索/利用权衡是数据驱动自适应控制中固有的挑战。尽管该权衡已在多臂老虎机(MAB)与线性系统强化学习中得到研究,但对于非线性系统基于学习的控制则研究较少。非线性设定下的一个重大理论挑战在于,对给定代价与系统参数集,不存在最优控制器的显式刻画。我们提出使用具备参数完全知识的有限时域预言控制器作为最优控制器的合理替代。这使我们能在基于学习的 MPC 与 MAB 背景下制定策略,并借助来自 MPC 与优化理论的技术开展控制理论分析,以证明这些策略相对于该有限时域预言实现了低遗憾。我们的仿真在具有部分未知代价函数的采暖、通风与空调模型上展现了策略的低遗憾性。
引用
@article{arxiv.2108.02307,
title = {Regret Analysis of Learning-Based MPC with Partially-Unknown Cost Function},
author = {Ilgin Dogan and Zuo-Jun Max Shen and Anil Aswani},
journal= {arXiv preprint arXiv:2108.02307},
year = {2023}
}
备注
16 pages, 2 figures