中文

具有时间划分奖励的多臂老虎机问题:当部分反馈起作用时

机器学习 2022-06-02 v1 人工智能

摘要

工业在线应用中数据顺序可用的兴趣日益增长。受向用户推荐播放列表的启发(用户偏好可在收听整个播放列表过程中收集),我们研究了一种新颖的bandit设定,即具有时间划分奖励的多臂老虎机(TP-MAB),其中与拉动一个臂相关的随机奖励在该拉动之后的有限个连续轮次中被划分。据我们所知,该设定此前未被探索,是将延迟反馈bandit自然推广到奖励在拉动后有限时间跨度内展开而非在单一潜在延迟轮次中完全披露的情形。我们提供两种算法来解决TP-MAB问题,即TP-UCB-FR和TP-UCB-EW,其利用了随时间收集的奖励所披露的部分信息。我们表明,当刻画广泛实际兴趣奖励结构的属性(即alpha-smoothness)成立时,我们的算法比延迟反馈bandit算法具有更好的渐近后悔上界。我们还在广泛设定下(包括合成生成和真实世界媒体推荐问题)对其性能进行了实证评估。

关键词

引用

@article{arxiv.2206.00586,
  title  = {Multi-Armed Bandit Problem with Temporally-Partitioned Rewards: When Partial Feedback Counts},
  author = {Giulia Romano and Andrea Agostini and Francesco Trovò and Nicola Gatti and Marcello Restelli},
  journal= {arXiv preprint arXiv:2206.00586},
  year   = {2022}
}