中文

基于模型与无模型强化学习的表示复杂度

机器学习 2024-03-12 v2

摘要

我们在电路复杂度框架下研究基于模型与无模型强化学习(RL)的表示复杂度。我们从理论上证明存在一大类MDP,其底层转移与奖励函数可用多项式规模的常数深度电路表示,而最优QQ函数在常数深度电路中承受指数级电路复杂度。通过关注近似误差并建立与复杂度理论的联系,我们的理论从新颖的表示复杂度视角为基于模型算法通常比无模型算法具有更好样本复杂度提供了独特见解:在某些情况下,环境的基本规则(模型)易于表示,而其他量(如QQ函数)看似复杂。我们在多个Mujoco环境中通过比较转移核、奖励函数与最优QQ函数的近似误差实证印证了我们的理论,表明转移核与奖励函数的近似误差始终低于最优QQ函数。据我们所知,本工作是首个研究RL电路复杂度的工作,也为未来研究提供了严谨框架。

关键词

引用

@article{arxiv.2310.01706,
  title  = {On Representation Complexity of Model-based and Model-free Reinforcement Learning},
  author = {Hanlin Zhu and Baihe Huang and Stuart Russell},
  journal= {arXiv preprint arXiv:2310.01706},
  year   = {2024}
}

备注

23 pages, 9 figures, to be published in ICLR 2024