中文

度量空间上可证明自适应的平均奖励强化学习

机器学习 2026-02-03 v2 人工智能

摘要

我们研究了 Lipschitz MDP 的无限时间平均奖励强化学习 (RL),该大类涵盖了线性 MDP 和 RKHS MDP 等几类重要的 MDP 以及函数逼近框架,并开发了一种自适应算法 ZoRL\text{ZoRL},其遗憾界为 O(T1deff.1)\mathcal{O}\big(T^{1 - d_{\text{eff.}}^{-1}}\big),其中 deff.=2dS+dz+3d_{\text{eff.}}= 2d_\mathcal{S} + d_z + 3dSd_\mathcal{S} 是状态空间的维度,dzd_z 是缩放维度。相比之下,具有固定离散化的算法产生的 deff.=2(dS+dA)+2d_{\text{eff.}} = 2(d_\mathcal{S} + d_\mathcal{A}) + 2,其中 dAd_\mathcal{A} 是动作空间的维度。ZoRL\text{ZoRL} 通过自适应地离散化状态-动作空间并缩放至状态-动作空间的“有前景区域”来实现这一点。dzd_z 是一个由状态-动作空间维度界定的依赖于问题的量,它使我们能够得出结论:如果一个 MDP 是良性的,那么 ZoRL\text{ZoRL} 的遗憾界将会很小。缩放维度和 ZoRL\text{ZoRL} 是真正自适应的,即当前工作展示了如何为无限时间平均奖励 RL 捕获自适应增益。ZoRL\text{ZoRL} 在实验中优于其他 state-of-the-art 算法,从而证明了由自适应带来的增益。

关键词

引用

@article{arxiv.2410.19919,
  title  = {Provably Adaptive Average Reward Reinforcement Learning for Metric Spaces},
  author = {Avik Kar and Rahul Singh},
  journal= {arXiv preprint arXiv:2410.19919},
  year   = {2026}
}

备注

Accepted in the 41st Conference on Uncertainty in Artificial Intelligence