中文

批量强化学习中被动数据收集的代价

机器学习 2023-07-06 v3 人工智能

摘要

在高风险应用中,主动实验可能被认为过于危险,因此数据常通过被动方式收集。虽然在简单情形(如 bandit)中被动与主动数据收集同样有效,但当从具有受控状态的系统收集数据时,被动采样的代价可能高得多。本文主要关注刻画这一代价。例如,在具有 S\mathrm{S} 个状态和 A\mathrm{A} 个动作的片段式有限状态-动作马尔可夫决策过程(MDP)中学习时,我们表明即使采用最佳(但被动选择的)记录策略,也需要(且足够) Ω(Amin(S1,H)/ε2)\Omega(\mathrm{A}^{\min(\mathrm{S}-1, H)}/\varepsilon^2) 个片段来获得 ϵ\epsilon-最优策略,其中 HH 为片段长度。注意这表明样本复杂度相比主动数据收集呈指数级膨胀,这一结果虽不意外,但据我们所知此前未发表过,且精确表达式的形式或许略令人惊讶。我们还将结果沿多个方向推广,如其他准则或函数逼近下的学习,并得到类似结论。我们结果的一个显著特征是对所出现指数的尖锐刻画,这对理解被动学习为何困难至关重要。

关键词

引用

@article{arxiv.2106.09973,
  title  = {The Curse of Passive Data Collection in Batch Reinforcement Learning},
  author = {Chenjun Xiao and Ilbin Lee and Bo Dai and Dale Schuurmans and Csaba Szepesvari},
  journal= {arXiv preprint arXiv:2106.09973},
  year   = {2023}
}

备注

27 pages, 2 figures. AISTATS 2022. In this revision, we fix an error in the previous upper bound results