具有延迟复合匿名反馈的随机多臂_bandit问题
机器学习
2019-10-14 v2 机器学习
摘要
我们探索了受真实世界应用启发的一种多臂_bandit(MAB)问题的新设定,我们称之为“随机延迟复合匿名反馈(SDCAF)”的_bandit。在 SDCAF 中,拉动臂上的奖励相对于时间是随机的,但在拉动臂后散布于未来固定的若干时间步内。该问题的复杂性源于对玩家的匿名反馈以及奖励的随机生成。由于奖励的聚合性质,玩家无法将奖励与过去某个特定时间步关联起来。我们针对这一更为复杂的 SDCAF 设定提出了两种算法,使用 UCB 算法的基于阶段的扩展。我们进行了后悔分析,以展示两种算法上亚线性的理论保证。
引用
@article{arxiv.1910.01161,
title = {Stochastic Bandits with Delayed Composite Anonymous Feedback},
author = {Siddhant Garg and Aditya Kumar Akash},
journal= {arXiv preprint arXiv:1910.01161},
year = {2019}
}
备注
33rd Conference on Neural Information Processing Systems (NeurIPS) Workshop on Machine Learning with Guarantees