中文

利用传递性进行基于分数的对决_bandit_top-k选择

机器学习 2021-01-01 v1

摘要

我们考虑带有分数信息的对决 Bandit (Dueling Bandit) 问题中的 top-k 子集选择。现实世界中的成对排序问题常表现出高度传递性,已有工作提出通过对 Bradley-Terry-Luce (BTL) 与 Thurstone 等参数化偏好模型的使用来利用此类传递性的采样方法。迄今,该工作聚焦于样本结果为胜/负二值响应的情形。我们将此扩展至采样结果含定量信息的选择问题,提出一种 Thurstone 式模型,并调整用于子集选择的成对最优计算预算分配 (POCBAm) 采样方法以利用该模型进行高效样本选择。我们将经验性能与标准 POCBAm 及其他竞争算法进行比较。

关键词

引用

@article{arxiv.2012.15637,
  title  = {Exploiting Transitivity for Top-k Selection with Score-Based Dueling Bandits},
  author = {Matthew Groves and Juergen Branke},
  journal= {arXiv preprint arXiv:2012.15637},
  year   = {2021}
}

备注

24 pages, 8 figures