中文

广义腐烂约束下无穷多臂老虎机的自适应方法

机器学习 2025-06-03 v4 机器学习

摘要

在本研究中,我们考虑在静止腐烂设置下的无穷多臂老虎机问题,其中臂的平均奖励可能随着每次拉动而减少,否则保持不变。我们探讨了关于奖励腐烂的两种场景:一种是累积腐烂量受VTV_T限制,称为慢腐烂情形;另一种是累积腐烂次数受STS_T限制,称为突腐烂情形。为了应对腐烂奖励带来的挑战,我们引入了一种利用自适应滑动窗口的UCB算法,旨在管理因奖励腐烂而产生的偏差-方差权衡。我们提出的算法在慢腐烂和突腐烂两种情形下都达到了紧致的遗憾界。最后,我们通过数值实验展示了算法的性能。

关键词

引用

@article{arxiv.2404.14202,
  title  = {An Adaptive Approach for Infinitely Many-armed Bandits under Generalized Rotting Constraints},
  author = {Jung-hun Kim and Milan Vojnovic and Se-Young Yun},
  journal= {arXiv preprint arXiv:2404.14202},
  year   = {2025}
}

备注

NeurIPS 2024