Thompson采样在线性二次控制中实现$\tilde O(\sqrt{T})$后悔界
机器学习
2022-06-20 v1 系统与控制
系统与控制
最优化与控制
机器学习
摘要
Thompson采样(TS)是一种在不确定性下高效决策的方法,其中动作从基于观测数据更新的精心设定的分布中采样。本工作中,我们研究使用TS对未知系统动态的稳定的线性二次调节器(LQR)进行自适应控制的问题。先前工作已确立频率主义后悔界对于LQR自适应控制是最优的。然而,现有方法要么仅在限制性设定下有效,要么需要先验已知的稳定控制器,要么采用计算上难以处理的方法。我们提出一种用于LQR自适应控制的高效TS算法,即基于TS的自适应控制(TSAC),其实现了后悔界,即便对多维系统亦如此,从而解决了Abeille和Lazaric(2018)提出的开放问题。TSAC不需要先验已知的稳定控制器,并通过在早期阶段有效探索环境来实现底层系统的快速稳定。我们的结果关键在于发展了TS提供乐观样本的概率的新下界。通过精心设定早期探索策略与策略更新规则,我们证明TS在多维稳定LQR的自适应控制中实现了阶最优后悔界。我们在若干自适应控制任务中实证展示了TSAC的性能与效率。
引用
@article{arxiv.2206.08520,
title = {Thompson Sampling Achieves $\tilde O(\sqrt{T})$ Regret in Linear Quadratic Control},
author = {Taylan Kargin and Sahin Lale and Kamyar Azizzadenesheli and Anima Anandkumar and Babak Hassibi},
journal= {arXiv preprint arXiv:2206.08520},
year = {2022}
}
备注
Accepted for presentation at the Conference on Learning Theory (COLT) 2022