面向在线控制的几何探索
机器学习
2020-10-30 v2 最优化与控制
机器学习
摘要
我们研究一般凸代价下\emph{未知}线性动力系统的控制问题。目标是最小化相对于扰动反馈控制器类的后悔值,该类涵盖所有稳定化线性动态控制器。本工作中,我们首先考虑代价函数已知的情形,为此设计了首个具有 后悔值的多项式时间算法,其中 为状态维数与控制输入维数之和。 的时域依赖是最优的,且改进了先前最佳的 上界。我们算法的主要组成部分是一种新颖的几何探索策略:我们在策略空间中自适应地构造一系列重心张成集。其次,我们考虑带宽反馈的情形,基于此借助随机带宽凸优化给出了首个具有 后悔值的多项式时间算法。
引用
@article{arxiv.2010.13178,
title = {Geometric Exploration for Online Control},
author = {Orestis Plevrakis and Elad Hazan},
journal= {arXiv preprint arXiv:2010.13178},
year = {2020}
}
备注
NeurIPS 2020