中文

马尔可夫跳跃仿射模型的在线学习与优化

信息论 2016-05-10 v1 math.IT

摘要

考虑了未知马尔可夫跳跃仿射模型的在线学习与优化问题。针对两种不同的优化目标:(i)调节问题的二次代价最小化与(ii)收益(利润)最大化,提出了一种称为马尔可夫同时扰动随机逼近(MSPSA)的在线学习策略。研究表明,MSPSA的遗憾值以学习时长的平方根阶增长。此外,利用van Trees不等式,证明任何策略的遗憾值增长都不慢于MSPSA,使得MSPSA成为一种阶最优的学习策略。另外,还证明了MSPSA策略几乎必然地以及在均方意义下收敛到最优控制输入。给出了仿真结果以说明MSPSA的遗憾值增长率,并表明MSPSA相对于贪婪确定性等价方法能带来显著增益。

关键词

引用

@article{arxiv.1605.02213,
  title  = {Online Learning and Optimization of Markov Jump Affine Models},
  author = {Sevi Baltaoglu and Lang Tong and Qing Zhao},
  journal= {arXiv preprint arXiv:1605.02213},
  year   = {2016}
}