中文

生灭过程中的强化学习:打破对状态空间的依赖

机器学习 2023-02-22 v1 机器学习

摘要

在本文中,我们重新审视具有生灭结构的MDP中无折扣强化学习的后悔值。具体而言,我们考虑一个具有不耐烦作业的受控队列,其主要目标是优化能耗与用户感知性能之间的权衡。在此设定下,MDP的直径 DDΩ(SS)\Omega(S^S),其中 SS 为状态数。因此,现有关于时刻 TT 的后悔值上下界(对于具有 SS 个状态和 AA 个动作的MDP为 O(DSAT)O(\sqrt{DSAT}) 阶)可能暗示强化学习在此效率低下。然而,在我们的主要结果中,我们利用MDP的结构证明:经典学习算法 {\sc Ucrl2} 的一个稍作调整的版本,其后悔值实际上以上界 O~(E2AT)\tilde{\mathcal{O}}(\sqrt{E_2AT}) 为界,其中 E2E_2 与参考策略平稳测度的加权二阶矩有关。重要的是,E2E_2 独立于 SS 有界。因此,我们的界在渐近意义上独立于状态数和直径。该结果基于对学习算法访问MDP各状态次数的细致研究,其分布高度非均匀。

关键词

引用

@article{arxiv.2302.10667,
  title  = {Reinforcement Learning in a Birth and Death Process: Breaking the Dependence on the State Space},
  author = {Jonatha Anselmi and Bruno Gaujal and Louis-Sébastien Rebuffi},
  journal= {arXiv preprint arXiv:2302.10667},
  year   = {2023}
}