中文

策略缩放:基于自适应离散化的无限视角平均奖励强化学习

机器学习 2025-11-18 v4

摘要

我们研究了针对连续空间 Lipschitz MDP 的无限视角平均奖励强化学习(RL),其中智能体可从给定策略集合 Φ\Phi 中选择策略。所提出的算法通过“缩放”Φ\Phi中“有前景区域”的方式高效探索策略空间,从而在性能上实现自适应收益。我们上界了这些算法的 regret 为 O~(T1deff.1)\tilde{\mathcal{O}}\big(T^{1 - d_{\text{eff.}}^{-1}}\big),其中 deff.=dzΦ+2d_{\text{eff.}} = d^\Phi_z+2(模型无关算法 PZRL-MF\textit{PZRL-MF})和 deff.=2dS+dzΦ+3d_{\text{eff.}} = 2d_\mathcal{S} + d^\Phi_z + 3(模型有关算法 PZRL-MB\textit{PZRL-MB})。这里 dSd_\mathcal{S} 为状态空间维数,dzΦd^\Phi_z 为给定策略集合 Φ\Phi 的缩放维数。dzΦd^\Phi_z 是问题复杂度的另一种度量,取决于底层 MDP 以及 Φ\Phi。因此,在问题实例良好且/或智能体对低复杂度 Φ\Phi(即 dzΦd^\Phi_z较小)时,所提出的算法表现出低 regret。当针对有限维策略空间时,我们得到 deff.d_{\text{eff.}} 在轻度技术条件下按该空间维数扩展;同时在平均奖励函数满足常见于多臂赌博机(MAB)文献的曲率条件下,得到 deff.=2d_{\text{eff.}} = 2,即 O~(T)\tilde{\mathcal{O}}(\sqrt{T})PZRL-MF\textit{PZRL-MF} regret。

关键词

引用

@article{arxiv.2405.18793,
  title  = {Policy Zooming: Adaptive Discretization-based Infinite-Horizon Average-Reward Reinforcement Learning},
  author = {Avik Kar and Rahul Singh},
  journal= {arXiv preprint arXiv:2405.18793},
  year   = {2025}
}

备注

38 pages, 3 figures