中文

等分性即所需:基于朗之万后验采样的次线性遗憾强化学习

机器学习 2025-02-06 v2 机器学习

摘要

常见假设(如线性或RKHS模型、高斯或对数凹后验)无法解释强化学习在更广泛分布和模型中的实际成功。因此,我们研究如何为等周分布(特别是满足对数索博列夫不等式(LSI)的分布)设计具有次线性遗憾的强化学习算法。LSI分布包括强化学习理论的标准设置以及其他分布,例如许多非对数凹和扰动分布。首先,我们证明如果数据分布满足LSI和一些温和的附加假设,基于后验采样的强化学习(PSRL)算法会产生次线性遗憾。此外,当我们无法计算或从精确后验采样时,我们提出一种基于朗之万采样的算法设计:LaPSRL。我们证明LaPSRL实现了阶最优遗憾和每回合次二次复杂度。最后,我们使用朗之万采样器SARAH-LD部署LaPSRL,并在不同的赌博机和MDP环境中进行测试。实验结果验证了LaPSRL在不同环境中的通用性及其相对于基线的竞争性能。

关键词

引用

@article{arxiv.2412.20824,
  title  = {Isoperimetry is All We Need: Langevin Posterior Sampling for RL with Sublinear Regret},
  author = {Emilio Jorge and Christos Dimitrakakis and Debabrota Basu},
  journal= {arXiv preprint arXiv:2412.20824},
  year   = {2025}
}