中文

自适应约束下具有线性函数逼近的可证明高效强化学习

机器学习 2022-01-04 v2 最优化与控制 机器学习

摘要

我们研究带自适应约束且采用线性函数逼近的强化学习(RL)。我们考虑两种流行的有限自适应模型:批学习模型与稀有策略切换模型,并为情节式线性马尔可夫决策过程提出两种高效在线 RL 算法,其中转移概率与奖励函数可表示为某已知特征映射的线性函数。具体而言,对于批学习模型,我们提出的 LSVI-UCB-Batch 算法达到 O~(d3H3T+dHT/B)\tilde O(\sqrt{d^3H^3T} + dHT/B) 的 regret,其中 dd 为特征映射维度,HH 为情节长度,TT 为交互次数,BB 为批数。我们的结果表明,仅使用 T/dH\sqrt{T/dH} 批即可获得 O~(d3H3T)\tilde O(\sqrt{d^3H^3T}) regret。对于稀有策略切换模型,我们提出的 LSVI-UCB-RareSwitch 算法享有 O~(d3H3T[1+T/(dH)]dH/B)\tilde O(\sqrt{d^3H^3T[1+T/(dH)]^{dH/B}}) regret,这意味着 dHlogTdH\log T 次策略切换足以获得 O~(d3H3T)\tilde O(\sqrt{d^3H^3T}) regret。我们的算法达到了与 LSVI-UCB 算法(Jin 等,2019)相同的 regret,但所需自适应量大幅减少。我们还建立了批学习模型的下界,表明我们 regret 界中对 BB 的依赖是紧的。

关键词

引用

@article{arxiv.2101.02195,
  title  = {Provably Efficient Reinforcement Learning with Linear Function Approximation Under Adaptivity Constraints},
  author = {Tianhao Wang and Dongruo Zhou and Quanquan Gu},
  journal= {arXiv preprint arXiv:2101.02195},
  year   = {2022}
}

备注

21 pages, 3 figures. In NeurIPS 2021