具有延迟、聚合匿名反馈的多臂老虎机
机器学习
2018-06-14 v3 机器学习
摘要
我们研究随机 -臂老虎机问题的一个变体,我们称之为“具有延迟、聚合匿名反馈的多臂老虎机”。在该问题中,当玩家拉动一个臂时,会产生一个奖励,然而该奖励不会立即被观察到。相反,在每一轮结束时,玩家只能观察到在给定轮次中恰好到达的若干先前产生的奖励之和。奖励被随机延迟,并且由于观察的聚合性质,哪个臂产生了特定奖励的信息丢失了。问题是由于这种延迟、聚合匿名反馈导致的信息丢失代价是多少?先前的工作研究了具有随机非匿名延迟的多臂老虎机,发现遗憾仅增加一个与预期延迟相关的加性因子。在本文中,我们表明,当预期延迟(或其界限)已知时,在更困难的延迟、聚合匿名反馈设定下仍可保持这种加性遗憾增加。我们提供了一种算法,当延迟有界时,其遗憾与非匿名问题的最坏情况遗憾完全匹配;当延迟无界时,则匹配至对数因子或一个加性方差项。
引用
@article{arxiv.1709.06853,
title = {Bandits with Delayed, Aggregated Anonymous Feedback},
author = {Ciara Pike-Burke and Shipra Agrawal and Csaba Szepesvari and Steffen Grunewalder},
journal= {arXiv preprint arXiv:1709.06853},
year = {2018}
}
备注
ICML 2018