中文

随机多臂赌博机中基于方差的遗憾的批量集成

机器学习 2024-09-16 v1 机器学习

摘要

高效地权衡探索与利用是在线强化学习(RL)的关键挑战之一。大多数工作通过仔细估计模型不确定性并遵循所谓的乐观模型来实现这一点。受实际集成方法的启发,在这项工作中,我们提出了一种简单且新颖的批量集成方案,可证明其在随机多臂赌博机(MAB)中实现了近乎最优的遗憾。关键是,我们的算法只有一个参数,即批次的数量,并且其值不依赖于损失尺度和方差等分布特性。我们通过在合成基准上展示算法的有效性来补充我们的理论结果。

关键词

引用

@article{arxiv.2409.08570,
  title  = {Batch Ensemble for Variance Dependent Regret in Stochastic Bandits},
  author = {Asaf Cassel and Orin Levy and Yishay Mansour},
  journal= {arXiv preprint arXiv:2409.08570},
  year   = {2024}
}