基于分布失配的扰动复杂度:再生核希尔伯特空间中强化学习的系统性分析
机器学习
2022-03-29 v2
摘要
现有的大多数强化学习(RL)理论分析受限于表格设定或线性模型,原因在于难以在高维空间中处理不确定环境下的函数逼近。本文通过分析一般再生核希尔伯特空间(RKHS)中的RL,为这一挑战提供了全新视角。我们考虑一族马尔可夫决策过程 ,其奖励函数位于某RKHS的单位球内,转移概率位于给定的任意集合中。我们定义了一种称为基于分布失配的扰动复杂度 的量,用以刻画在RKHS中以尺度 进行扰动时, admissible 状态-动作分布空间的复杂度。我们证明 既给出了所有可能算法误差的下界,也给出了针对该RL问题的两种特定算法(拟合奖励与拟合Q迭代)误差的上界。因此, 随 的衰减度量了 上RL问题的难度。我们进一步给出了一些具体示例,并讨论了在这些示例中 衰减快慢与否。作为副产品,我们证明当奖励函数位于高维RKHS中时,即便转移概率已知且动作空间有限,RL问题仍可能遭受维度灾难。
引用
@article{arxiv.2111.03469,
title = {Perturbational Complexity by Distribution Mismatch: A Systematic Analysis of Reinforcement Learning in Reproducing Kernel Hilbert Space},
author = {Jihao Long and Jiequn Han},
journal= {arXiv preprint arXiv:2111.03469},
year = {2022}
}