中文

基于分布失配的扰动复杂度:再生核希尔伯特空间中强化学习的系统性分析

机器学习 2022-03-29 v2

摘要

现有的大多数强化学习(RL)理论分析受限于表格设定或线性模型,原因在于难以在高维空间中处理不确定环境下的函数逼近。本文通过分析一般再生核希尔伯特空间(RKHS)中的RL,为这一挑战提供了全新视角。我们考虑一族马尔可夫决策过程 M\mathcal{M},其奖励函数位于某RKHS的单位球内,转移概率位于给定的任意集合中。我们定义了一种称为基于分布失配的扰动复杂度 ΔM(ϵ)\Delta_{\mathcal{M}}(\epsilon) 的量,用以刻画在RKHS中以尺度 ϵ\epsilon 进行扰动时, admissible 状态-动作分布空间的复杂度。我们证明 ΔM(ϵ)\Delta_{\mathcal{M}}(\epsilon) 既给出了所有可能算法误差的下界,也给出了针对该RL问题的两种特定算法(拟合奖励与拟合Q迭代)误差的上界。因此,ΔM(ϵ)\Delta_\mathcal{M}(\epsilon)ϵ\epsilon 的衰减度量了 M\mathcal{M} 上RL问题的难度。我们进一步给出了一些具体示例,并讨论了在这些示例中 ΔM(ϵ)\Delta_{\mathcal{M}}(\epsilon) 衰减快慢与否。作为副产品,我们证明当奖励函数位于高维RKHS中时,即便转移概率已知且动作空间有限,RL问题仍可能遭受维度灾难。

关键词

引用

@article{arxiv.2111.03469,
  title  = {Perturbational Complexity by Distribution Mismatch: A Systematic Analysis of Reinforcement Learning in Reproducing Kernel Hilbert Space},
  author = {Jihao Long and Jiequn Han},
  journal= {arXiv preprint arXiv:2111.03469},
  year   = {2022}
}