具有广义时间划分奖励的多臂老虎机
机器学习
2023-03-02 v1 机器学习
摘要
具有序列性质的决策问题,即过去的决策可能对未来产生影响,被用于建模许多实际重要的应用。在一些现实应用中,关于某一决策的反馈被延迟,并可能通过在不同延迟下观测到的部分奖励到达。受此类场景启发,我们提出了一种称为具有广义时间划分奖励的多臂老虎机的新问题形式。为形式化关于某一决策的反馈如何在多个时间步上被划分,我们引入了β-扩散性质。我们推导了所考虑问题中任何一致高效算法的性能下界。此外,我们提供了一种称为TP-UCB-FR-G的算法,并证明了其性能度量的上界。在某些场景中,我们的上界优于现有最优结果。我们提供了验证所提算法及理论结果的实验结果。
引用
@article{arxiv.2303.00620,
title = {Multi-Armed Bandits with Generalized Temporally-Partitioned Rewards},
author = {Ronald C. van den Broek and Rik Litjens and Tobias Sagis and Luc Siecker and Nina Verbeeke and Pratik Gajane},
journal= {arXiv preprint arXiv:2303.00620},
year = {2023}
}