中文

具有依赖臂的多对决Bandits

机器学习 2017-05-02 v1

摘要

对决Bandits问题是一种用于从成对偏好反馈中学习的在线学习框架,特别适合建模引发主观或隐式人类反馈的设置。本文研究具有依赖臂的多对决Bandits问题,它将原始对决Bandits设置扩展为同时对数个臂进行对决,并对臂之间的依赖关系建模。这些扩展捕捉了众多真实应用场景中的关键特征,并使得开发比原始设置中可能实现的显著更高效的算法成为可能。我们提出了\selfsparring算法,该算法将多对决Bandits问题归约为可使用诸如Thompson Sampling之类的随机Bandit算法解决的常规Bandit设置,并能够利用高斯过程先验自然地对依赖关系建模。我们给出了多对决设置的无后悔分析,并在广泛的仿真设置上实证展示了算法的有效性。

关键词

引用

@article{arxiv.1705.00253,
  title  = {Multi-dueling Bandits with Dependent Arms},
  author = {Yanan Sui and Vincent Zhuang and Joel W. Burdick and Yisong Yue},
  journal= {arXiv preprint arXiv:1705.00253},
  year   = {2017}
}