中文

预见在线学习在控制中的长期效应

机器学习 2020-07-27 v1 系统与控制 系统与控制 机器学习

摘要

利用在线采集的测量数据进行学习的控制方案,对于复杂和不确定性系统的控制日益展现出前景。然而,在大多数此类方法中,学习被视为一种被动提升控制性能的副作用,例如通过更新系统动力学模型。如何在学习型控制综合中主动利用因学习而带来的控制性能提升,仍然是一个开放的研究问题。本文提出 AntLer,一种基于学习的控制律设计算法,该算法能够预见学习,即明确考虑未来学习在不确定动态环境中的影响。AntLer 使用非参数概率模型来表达系统不确定性。给定一个衡量控制性能的代价函数,AntLer 选择控制参数,使得闭环系统的期望代价近似最小化。我们证明,AntLer 以概率1任意精确地逼近最优解。此外,我们将 AntLer 应用于一个非线性系统,与未预见学习的情况相比,取得了更好的结果。

关键词

引用

@article{arxiv.2007.12377,
  title  = {Anticipating the Long-Term Effect of Online Learning in Control},
  author = {Alexandre Capone and Sandra Hirche},
  journal= {arXiv preprint arXiv:2007.12377},
  year   = {2020}
}