中文

具有相似性信息的多目标上下文赌博机问题

机器学习 2018-03-13 v1 机器学习

摘要

在本文中,我们提出具有相似性信息的多目标上下文赌博机问题。该问题通过引入多个且可能冲突的目标,推广了经典的具有相似性信息的上下文赌博机问题。由于在给定上下文时各目标下的最优臂可能不同,基于单一目标学习最优臂可能损害从其他目标获得的奖励。为了评估此设定下学习器的性能,我们采用一种称为上下文 Pareto 遗憾的性能度量。本质上,上下文 Pareto 遗憾是学习器所选臂到依赖于上下文的 Pareto 前沿的距离之和。对于该问题,我们开发了一种新的在线学习算法,称为 Pareto Contextual Zooming (PCZ),它利用上下文缩放的思想,通过根据观测到的奖励及过去所选上下文-臂对的位置自适应地划分联合上下文-臂集合,来学习对每个观测上下文接近 Pareto 前沿的臂。随后,我们证明 PCZ 达到 O~(T(1+dp)/(2+dp))\tilde O (T^{(1+d_p)/(2+d_p)}) 的 Pareto 遗憾,其中 dpd_p 为依赖于近最优上下文-臂对集合大小的 Pareto 缩放维数。此外,我们通过给出一个几乎匹配的 Ω(T(1+dp)/(2+dp))\Omega (T^{(1+d_p)/(2+d_p)}) 下界,表明该遗憾界近乎最优。

关键词

引用

@article{arxiv.1803.04015,
  title  = {Multi-objective Contextual Bandit Problem with Similarity Information},
  author = {Eralp Turğay and Doruk Öner and Cem Tekin},
  journal= {arXiv preprint arXiv:1803.04015},
  year   = {2018}
}

备注

The 21st International Conference on Artificial Intelligence and Statistics (AISTATS 2018)