中文

在线稀疏强化学习

机器学习 2021-02-11 v4 统计理论 机器学习 统计理论

摘要

我们研究固定时域、稀疏线性马尔可夫决策过程(MDP)中在线强化学习的困难性,特别关注环境维度大于回合数的高维情形。我们的贡献有两方面。首先,我们给出一个下界,表明即便存在能收集良态数据的策略,此情形下线性后悔通常不可避免。该下界构造使用一个具有固定状态数而动作数随环境维度增长的MDP。注意当时域固定为1时(即线性随机_bandit情形),线性后悔可避免。其次,我们表明若学习器能预言式访问一个收集良态数据的策略,则Lasso拟合Q迭代的一个变体享有几乎与维度无关的后悔O~(s2/3N2/3)\tilde{O}( s^{2/3} N^{2/3}),其中NN为回合数,ss为稀疏度。这表明在大动作设定下,学习的困难可归因于寻找良好探索策略的困难。

关键词

引用

@article{arxiv.2011.04018,
  title  = {Online Sparse Reinforcement Learning},
  author = {Botao Hao and Tor Lattimore and Csaba Szepesvári and Mengdi Wang},
  journal= {arXiv preprint arXiv:2011.04018},
  year   = {2021}
}

备注

Accepted at AISTATS 2021