批量强化学习中被动数据收集的代价
机器学习
2023-07-06 v3 人工智能
摘要
在高风险应用中,主动实验可能被认为过于危险,因此数据常通过被动方式收集。虽然在简单情形(如 bandit)中被动与主动数据收集同样有效,但当从具有受控状态的系统收集数据时,被动采样的代价可能高得多。本文主要关注刻画这一代价。例如,在具有 个状态和 个动作的片段式有限状态-动作马尔可夫决策过程(MDP)中学习时,我们表明即使采用最佳(但被动选择的)记录策略,也需要(且足够) 个片段来获得 -最优策略,其中 为片段长度。注意这表明样本复杂度相比主动数据收集呈指数级膨胀,这一结果虽不意外,但据我们所知此前未发表过,且精确表达式的形式或许略令人惊讶。我们还将结果沿多个方向推广,如其他准则或函数逼近下的学习,并得到类似结论。我们结果的一个显著特征是对所出现指数的尖锐刻画,这对理解被动学习为何困难至关重要。
引用
@article{arxiv.2106.09973,
title = {The Curse of Passive Data Collection in Batch Reinforcement Learning},
author = {Chenjun Xiao and Ilbin Lee and Bo Dai and Dale Schuurmans and Csaba Szepesvari},
journal= {arXiv preprint arXiv:2106.09973},
year = {2023}
}
备注
27 pages, 2 figures. AISTATS 2022. In this revision, we fix an error in the previous upper bound results