中文

基于奖励样本的序列多臂老虎机迁移学习

机器学习 2024-03-20 v1 机器学习

摘要

我们考虑一个序列随机多臂老虎机问题,其中智能体在多个回合中与老虎机交互。臂的奖励分布在一个回合内保持不变,但在不同回合之间可能发生变化。我们提出了一种基于 UCB 的算法,用于迁移先前回合的奖励样本,并改善所有回合的累积遗憾性能。我们给出了该算法的遗憾分析和实证结果,结果表明其性能显著优于无迁移的标准 UCB 算法。

关键词

引用

@article{arxiv.2403.12428,
  title  = {Transfer in Sequential Multi-armed Bandits via Reward Samples},
  author = {Rahul N R and Vaibhav Katewa},
  journal= {arXiv preprint arXiv:2403.12428},
  year   = {2024}
}

备注

Paper accepted in ECC 2024