中文

爱丽丝在马尔可夫世界中的冒险

系统与控制 2019-07-23 v1 机器学习 机器人学 系统与控制

摘要

本文提出一种名为 Alice 的算法,该算法无法获知环境的物理定律(环境实为带随机噪声的线性系统),并直接在线进行决策,无需训练阶段或作为初始输入的稳态策略。所提算法既不在线估计系统参数也不估计值函数,而是将最基本的在线学习算法之一 Follow-the-Leader 推广至线性 Gauss-Markov 过程设定,带有类似于梯度下降算法中动量法的正则化项,以及受 Lyapunov 第二定理启发的可行在线约束。该算法被视为模型预测控制的镜像优化。在仅知晓状态-动作对齐关系且能够精确观测每一状态的情况下,给出了无状态噪声时算法的无后悔证明。针对带随机噪声的一般线性系统,给出了无后悔证明的充分条件分析。仿真将 Alice 与另一近期工作的性能进行比较,并验证了 Alice 的极大灵活性。

关键词

引用

@article{arxiv.1907.08981,
  title  = {Alice's Adventures in the Markovian World},
  author = {Zhanzhan Zhao and Haoran Sun},
  journal= {arXiv preprint arXiv:1907.08981},
  year   = {2019}
}

备注

9 pages, 4 figures