基于奖励样本的序列多臂老虎机迁移学习
机器学习
2024-03-20 v1 机器学习
摘要
我们考虑一个序列随机多臂老虎机问题,其中智能体在多个回合中与老虎机交互。臂的奖励分布在一个回合内保持不变,但在不同回合之间可能发生变化。我们提出了一种基于 UCB 的算法,用于迁移先前回合的奖励样本,并改善所有回合的累积遗憾性能。我们给出了该算法的遗憾分析和实证结果,结果表明其性能显著优于无迁移的标准 UCB 算法。
引用
@article{arxiv.2403.12428,
title = {Transfer in Sequential Multi-armed Bandits via Reward Samples},
author = {Rahul N R and Vaibhav Katewa},
journal= {arXiv preprint arXiv:2403.12428},
year = {2024}
}
备注
Paper accepted in ECC 2024