中文

对抗式在线控制的对数后悔界

机器学习 2020-06-24 v3 最优化与控制 机器学习

摘要

我们提出一种用于已知系统中受对抗扰动影响的在线线性二次控制的新算法。该设定下已有的后悔界尺度为 T\sqrt{T},除非对扰动过程施加强随机假设。我们给出了首个针对任意对抗扰动序列具有对数后悔的算法,前提是状态与控制代价由已知二次函数给出。我们的算法与分析利用最优离线控制律的刻画,将在线控制问题归约为带近似优势函数的(延迟)在线学习。与先前技术相比,我们的方法无需控制迭代量的移动代价,从而实现对数量级后悔。

关键词

引用

@article{arxiv.2003.00189,
  title  = {Logarithmic Regret for Adversarial Online Control},
  author = {Dylan J. Foster and Max Simchowitz},
  journal= {arXiv preprint arXiv:2003.00189},
  year   = {2020}
}

备注

ICML 2020