具有依赖臂的多对决Bandits
机器学习
2017-05-02 v1
摘要
对决Bandits问题是一种用于从成对偏好反馈中学习的在线学习框架,特别适合建模引发主观或隐式人类反馈的设置。本文研究具有依赖臂的多对决Bandits问题,它将原始对决Bandits设置扩展为同时对数个臂进行对决,并对臂之间的依赖关系建模。这些扩展捕捉了众多真实应用场景中的关键特征,并使得开发比原始设置中可能实现的显著更高效的算法成为可能。我们提出了\selfsparring算法,该算法将多对决Bandits问题归约为可使用诸如Thompson Sampling之类的随机Bandit算法解决的常规Bandit设置,并能够利用高斯过程先验自然地对依赖关系建模。我们给出了多对决设置的无后悔分析,并在广泛的仿真设置上实证展示了算法的有效性。
引用
@article{arxiv.1705.00253,
title = {Multi-dueling Bandits with Dependent Arms},
author = {Yanan Sui and Vincent Zhuang and Joel W. Burdick and Yisong Yue},
journal= {arXiv preprint arXiv:1705.00253},
year = {2017}
}