连续时间线性二次系统中确定性等价策略的遗憾分析
机器学习
2022-08-23 v2 系统与控制
系统与控制
最优化与控制
机器学习
摘要
本工作从理论层面研究了用于控制连续时间随机线性二次系统典型模型的一种普遍存在的强化学习策略。我们表明,随机化确定性等价策略解决了依据未知随机微分方程演化且运行代价为二次型的线性控制系统中的探索-利用困境。更确切地说,我们建立了时间平方根遗憾界,表明随机化确定性等价策略能从单条状态轨迹中快速学习最优控制动作。此外,还展示了遗憾随参数数量呈线性缩放。所提出的分析引入了新颖且有用的技术方法,并阐明了连续时间强化学习的基本挑战。
引用
@article{arxiv.2206.04434,
title = {Regret Analysis of Certainty Equivalence Policies in Continuous-Time Linear-Quadratic Systems},
author = {Mohamad Kazem Shirani Faradonbeh},
journal= {arXiv preprint arXiv:2206.04434},
year = {2022}
}