具有图结构反馈的非随机多臂老虎机
机器学习
2014-10-01 v1 机器学习
摘要
我们提出并研究了一种在线学习的部分信息模型,其中决策者反复从有限动作集中进行选择,并观察相关损失的某个子集。这自然地建模了几种不同动作的损失相互关联的情况,即知道一个动作的损失可提供关于其他动作损失的信息。此外,它推广并在充分研究的完全信息设定(所有损失均被揭示)和老虎机设定(仅揭示玩家所选动作的损失)之间进行插值。我们提供了几种针对我们设定不同变体的算法,并提供了取决于信息反馈结构组合性质的紧 regrets 界。
引用
@article{arxiv.1409.8428,
title = {Nonstochastic Multi-Armed Bandits with Graph-Structured Feedback},
author = {Noga Alon and Nicolò Cesa-Bianchi and Claudio Gentile and Shie Mannor and Yishay Mansour and Ohad Shamir},
journal= {arXiv preprint arXiv:1409.8428},
year = {2014}
}
备注
Preliminary versions of parts of this paper appeared in [1,20], and also as arXiv papers arXiv:1106.2436 and arXiv:1307.4564