基于反馈控制稳定性分析的带跳跃线性凸模型强化学习
最优化与控制
2022-03-03 v2 机器学习
机器学习
摘要
我们研究情节式设定下有限时间域连续时间线性凸强化学习问题。在该问题中,未知线性跳跃扩散过程受非光滑凸成本约束进行控制。我们证明相关的线性凸控制问题容许利普希茨连续的最优反馈控制,并进一步证明反馈控制的利普希茨稳定性,即,对错误模型与真实模型应用反馈控制的性能差距对模型系数扰动的幅度呈利普希茨连续依赖;证明依赖于对相关正倒向随机微分方程的稳定性分析。随后我们提出一种新颖的最小二乘算法,在带跳跃的线性凸学习问题上达到量级的后悔值,其中为学习情节数;该分析利用了反馈控制的利普希茨稳定性与亚韦布尔随机变量的集中性质。数值实验证实了所提算法的收敛性与鲁棒性。
引用
@article{arxiv.2104.09311,
title = {Reinforcement learning for linear-convex models with jumps via stability analysis of feedback controls},
author = {Xin Guo and Anran Hu and Yufei Zhang},
journal= {arXiv preprint arXiv:2104.09311},
year = {2022}
}
备注
Add two sessions on controlled diffusion extension and numerical experiment