自适应约束下具有线性函数逼近的可证明高效强化学习
机器学习
2022-01-04 v2 最优化与控制
机器学习
摘要
我们研究带自适应约束且采用线性函数逼近的强化学习(RL)。我们考虑两种流行的有限自适应模型:批学习模型与稀有策略切换模型,并为情节式线性马尔可夫决策过程提出两种高效在线 RL 算法,其中转移概率与奖励函数可表示为某已知特征映射的线性函数。具体而言,对于批学习模型,我们提出的 LSVI-UCB-Batch 算法达到 的 regret,其中 为特征映射维度, 为情节长度, 为交互次数, 为批数。我们的结果表明,仅使用 批即可获得 regret。对于稀有策略切换模型,我们提出的 LSVI-UCB-RareSwitch 算法享有 regret,这意味着 次策略切换足以获得 regret。我们的算法达到了与 LSVI-UCB 算法(Jin 等,2019)相同的 regret,但所需自适应量大幅减少。我们还建立了批学习模型的下界,表明我们 regret 界中对 的依赖是紧的。
引用
@article{arxiv.2101.02195,
title = {Provably Efficient Reinforcement Learning with Linear Function Approximation Under Adaptivity Constraints},
author = {Tianhao Wang and Dongruo Zhou and Quanquan Gu},
journal= {arXiv preprint arXiv:2101.02195},
year = {2022}
}
备注
21 pages, 3 figures. In NeurIPS 2021