在线稀疏强化学习
机器学习
2021-02-11 v4 统计理论
机器学习
统计理论
摘要
我们研究固定时域、稀疏线性马尔可夫决策过程(MDP)中在线强化学习的困难性,特别关注环境维度大于回合数的高维情形。我们的贡献有两方面。首先,我们给出一个下界,表明即便存在能收集良态数据的策略,此情形下线性后悔通常不可避免。该下界构造使用一个具有固定状态数而动作数随环境维度增长的MDP。注意当时域固定为1时(即线性随机_bandit情形),线性后悔可避免。其次,我们表明若学习器能预言式访问一个收集良态数据的策略,则Lasso拟合Q迭代的一个变体享有几乎与维度无关的后悔,其中为回合数,为稀疏度。这表明在大动作设定下,学习的困难可归因于寻找良好探索策略的困难。
引用
@article{arxiv.2011.04018,
title = {Online Sparse Reinforcement Learning},
author = {Botao Hao and Tor Lattimore and Csaba Szepesvári and Mengdi Wang},
journal= {arXiv preprint arXiv:2011.04018},
year = {2021}
}
备注
Accepted at AISTATS 2021