马尔可夫跳跃仿射模型的在线学习与优化
信息论
2016-05-10 v1 math.IT
摘要
考虑了未知马尔可夫跳跃仿射模型的在线学习与优化问题。针对两种不同的优化目标:(i)调节问题的二次代价最小化与(ii)收益(利润)最大化,提出了一种称为马尔可夫同时扰动随机逼近(MSPSA)的在线学习策略。研究表明,MSPSA的遗憾值以学习时长的平方根阶增长。此外,利用van Trees不等式,证明任何策略的遗憾值增长都不慢于MSPSA,使得MSPSA成为一种阶最优的学习策略。另外,还证明了MSPSA策略几乎必然地以及在均方意义下收敛到最优控制输入。给出了仿真结果以说明MSPSA的遗憾值增长率,并表明MSPSA相对于贪婪确定性等价方法能带来显著增益。
引用
@article{arxiv.1605.02213,
title = {Online Learning and Optimization of Markov Jump Affine Models},
author = {Sevi Baltaoglu and Lang Tong and Qing Zhao},
journal= {arXiv preprint arXiv:1605.02213},
year = {2016}
}