中文

面向在线控制的几何探索

机器学习 2020-10-30 v2 最优化与控制 机器学习

摘要

我们研究一般凸代价下\emph{未知}线性动力系统的控制问题。目标是最小化相对于扰动反馈控制器类的后悔值,该类涵盖所有稳定化线性动态控制器。本工作中,我们首先考虑代价函数已知的情形,为此设计了首个具有 n3Tn^3\sqrt{T} 后悔值的多项式时间算法,其中 nn 为状态维数与控制输入维数之和。T\sqrt{T} 的时域依赖是最优的,且改进了先前最佳的 T2/3T^{2/3} 上界。我们算法的主要组成部分是一种新颖的几何探索策略:我们在策略空间中自适应地构造一系列重心张成集。其次,我们考虑带宽反馈的情形,基于此借助随机带宽凸优化给出了首个具有 poly(n)Tpoly(n)\sqrt{T} 后悔值的多项式时间算法。

关键词

引用

@article{arxiv.2010.13178,
  title  = {Geometric Exploration for Online Control},
  author = {Orestis Plevrakis and Elad Hazan},
  journal= {arXiv preprint arXiv:2010.13178},
  year   = {2020}
}

备注

NeurIPS 2020