面向时间划分奖励多臂_bandit的局部奖励分布泛化
机器学习
2022-11-15 v1 机器学习
摘要
本文研究具有时间划分奖励(Temporally-Partitioned Rewards, TP-MAB)设定的多臂_bandit问题。在 TP-MAB 设定中,智能体将在多轮中接收某臂奖励的子集,而非一次性获得该臂的全部奖励。本文引入了一种关于臂的累积奖励如何在若干轮中分布的一般化表述,称为 Beta-spread 性质。需要此种泛化以处理每轮最大奖励并非均匀分布于各轮的分划奖励。我们在 Beta-spread 成立的假设下推导了 TP-MAB 问题的下界。此外,我们提供了一种算法 TP-UCB-FR-G,其利用 Beta-spread 性质在某些场景中改进了后悔上界。通过泛化累积奖励的分布方式,该设定可适用于更广泛的应用范围。
引用
@article{arxiv.2211.06883,
title = {Generalizing distribution of partial rewards for multi-armed bandits with temporally-partitioned rewards},
author = {Ronald C. van den Broek and Rik Litjens and Tobias Sagis and Luc Siecker and Nina Verbeeke and Pratik Gajane},
journal= {arXiv preprint arXiv:2211.06883},
year = {2022}
}