中文

具有_bandit_反馈的非随机控制

机器学习 2020-08-14 v1 最优化与控制 机器学习

摘要

我们研究在对抗性扰动下控制线性动力学系统的问题,其中控制器唯一可用的反馈是标量损失,且损失函数本身未知。对于该问题,无论系统已知或未知,我们都给出了一种高效的次线性后悔算法。主要的算法困难在于损失对过去控制的依赖。为克服此问题,我们针对具有记忆的损失函数提出了一种用于 bandit 凸优化一般设置的高效算法,这本身可能具有独立意义。

关键词

引用

@article{arxiv.2008.05523,
  title  = {Non-Stochastic Control with Bandit Feedback},
  author = {Paula Gradu and John Hallman and Elad Hazan},
  journal= {arXiv preprint arXiv:2008.05523},
  year   = {2020}
}