中文

具有上下文分布的随机_bandit问题

机器学习 2019-11-15 v2 机器学习

摘要

我们引入一种随机上下文_bandit模型,其中在每一步环境选择上下文集合上的一个分布并从中采样上下文。学习器仅观测到上下文分布,而具体的上下文实现保持隐藏。这允许了一系列广泛的应用,其中上下文是随机的,或者学习器需要预测上下文。我们将 UCB 算法应用于该设定,并证明其对于线性和核化奖励函数在累积后悔上达到了序最优的高概率界。我们的结果严格推广了先前的工作,因为我们的模型和算法在环境仅选择狄拉克δ分布从而向学习器提供精确上下文时退化为标准设定。我们进一步分析了学习器在选择动作后观测到已实现上下文的一种变体。最后,我们在合成和真实世界数据集上演示了所提方法。

关键词

引用

@article{arxiv.1906.02685,
  title  = {Stochastic Bandits with Context Distributions},
  author = {Johannes Kirschner and Andreas Krause},
  journal= {arXiv preprint arXiv:1906.02685},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019