中文

悲观主义对离线强化学习是否可证明高效?

机器学习 2022-05-06 v3 人工智能 最优化与控制 统计理论 机器学习 统计理论

摘要

我们研究离线强化学习(RL),其目标基于先验收集的数据集学习最优策略。由于缺乏与环境的进一步交互,离线RL受到数据集覆盖不足的影响,这令大多数现有理论分析难以应对。本文提出价值迭代算法的一种悲观变体(PEVI),其将不确定性量化器作为惩罚函数。该惩罚函数简单地翻转了在线RL中用于促进探索的奖励函数的符号,使其易于实现且与通用函数逼近器兼容。在不假设数据集充分覆盖的条件下,我们建立了PEVI在一般马尔可夫决策过程(MDPs)上次优性的数据依赖上界。当特化到线性MDPs时,该上界在维数与时域的乘性因子范围内与信息论下界相匹配。换言之,悲观主义不仅可证明高效,而且是极小极大最优的。特别地,给定数据集,所学策略在所有策略中充当“最大努力”,因为无其他策略能做得更好。我们的理论分析揭示了悲观主义在消除一种虚假相关概念中的关键作用,该概念源于数据集中覆盖较少且对最优策略无信息的“无关”轨迹。

关键词

引用

@article{arxiv.2012.15085,
  title  = {Is Pessimism Provably Efficient for Offline RL?},
  author = {Ying Jin and Zhuoran Yang and Zhaoran Wang},
  journal= {arXiv preprint arXiv:2012.15085},
  year   = {2022}
}

备注

This version adds results on RKHS, and a data-splitting algorithm