中文

基于后验采样的未知线性系统控制强化学习的一个放宽技术假设

系统与控制 2022-09-21 v2 人工智能 系统与控制 最优化与控制

摘要

我们重新审视Ouyang等人(arXiv:1709.04047)最近提出的用于控制未知线性二次(LQ)系统的Thompson采样算法。该算法的后悔界是在关于闭环系统诱导范数的一个技术假设下推导的。在本技术注记中,我们表明通过对算法做微小修改(特别地,确保一个回合不会过早结束),该关于诱导范数的技术假设可被替换为关于闭环系统谱半径的更温和假设。修改后的算法具有相同的贝叶斯后悔O~(T)\tilde{\mathcal{O}}(\sqrt{T}),其中TT为时间范围,O~()\tilde{\mathcal{O}}(\cdot)符号隐藏了TT中的对数项。

关键词

引用

@article{arxiv.2108.08502,
  title  = {A relaxed technical assumption for posterior sampling-based reinforcement learning for control of unknown linear systems},
  author = {Mukul Gagrani and Sagar Sudhakara and Aditya Mahajan and Ashutosh Nayyar and Yi Ouyang},
  journal= {arXiv preprint arXiv:2108.08502},
  year   = {2022}
}