中文

Plackett-Luce 模型中的 PAC 对战多臂老虎机问题

机器学习 2019-03-05 v3 机器学习

摘要

我们引入了基于 Plackett-Luce (PL) 子集选择模型的很可能近似正确 (PAC) \emph{对战多臂老虎机} (Battling-Bandit) 问题——一种在线学习框架,其中学习者在每轮试验中从固定的 nn 个臂中选择大小为 kk 的子集,随后观察到随机反馈,指示所选子集中条目的偏好信息,例如最受偏好的条目或前 mm 个最受偏好条目的排序等。目标是高置信度地识别底层 PL 模型中的近最优条目。这推广了经过充分研究的针对 nn 个臂的 PAC \emph{对决多臂老虎机} (Dueling-Bandit) 问题,该问题旨在从成对偏好信息中恢复 \emph{最优臂},且已知其样本复杂度为 O(nϵ2ln1δ)O(\frac{n}{\epsilon^2} \ln \frac{1}{\delta}) \citep{Busa_pl,Busa_top}。我们研究了该问题在各种反馈模型下的样本复杂度:(1) 子集胜者 (WI),以及 (2) 前 mm 个条目的排序 (TR),其中 2mk2\le m \le k。我们惊讶地发现,在大小为 2kn2 \leq k \leq n 的子集上采用胜者信息 (WI) 反馈时,最佳可实现的样本复杂度仍为 O(nϵ2ln1δ)O\left( \frac{n}{\epsilon^2} \ln \frac{1}{\delta}\right),与 kk 无关,且与对决多臂老虎机设定 (k=2k=2) 相同。对于更通用的前 mm 排序 (TR) 反馈模型,我们给出了显著更小的样本复杂度下界 Ω(nmϵ2ln1δ)\Omega\bigg( \frac{n}{m\epsilon^2} \ln \frac{1}{\delta}\bigg),这表明由于从 mm 个条目(而非仅 11 个)之间的偏好揭示了额外信息,样本复杂度可乘性地降低 mm 倍。我们还针对具有 TR 反馈模型的 PAC 问题提出了两种算法,其样本复杂度保证是最优的(直至对数因子),确立了利用排序反馈所带来的统计效率提升。

关键词

引用

@article{arxiv.1808.04008,
  title  = {PAC Battling Bandits in the Plackett-Luce Model},
  author = {Aadirupa Saha and Aditya Gopalan},
  journal= {arXiv preprint arXiv:1808.04008},
  year   = {2019}
}

备注

In 30th International Conference on Algorithmic Learning Theory (ALT), 2019. (45 pages)