切换线性控制系统的期望奖励学习:一种非渐近视角
概率论
2020-06-16 v1 机器学习
系统与控制
系统与控制
摘要
在这项工作中,我们在系统动力学在 的某个无界子集上满足范数稳定性假设的前提下,证明了切换线性动力系统(SLDSs)的不变遍历测度的存在性。因此,给定平稳马尔可夫控制策略,我们利用 Birkhoff 遍历定理推导了从时间平均学习期望奖励(相对于我们闭环系统所混合到的不变遍历测度)的非渐近界。所呈现的结果为推导 SLDSs 基于平均奖励的最优控制的 non-asymptotic 分析奠定了基础。最后,我们在两个案例研究中说明了所呈现的理论结果。
引用
@article{arxiv.2006.08105,
title = {Learning Expected Reward for Switched Linear Control Systems: A Non-Asymptotic View},
author = {Muhammad Abdullah Naeem and Miroslav Pajic},
journal= {arXiv preprint arXiv:2006.08105},
year = {2020}
}