中文

利用相关性在低秩偏好老虎机中实现更快学习率

机器学习 2022-02-25 v1 人工智能

摘要

我们引入了基于随机效用选择模型(RUMs)的\emph{相关偏好老虎机}(Correlated Preference Bandits)问题,其目标是通过在线子集式偏好反馈从给定的nn个物品池中识别出最优物品。我们研究具有简单相关结构(例如低秩)的模型是否能够带来更快的学习率。虽然我们表明该问题对于一般“低秩”选择模型可能无法求解,但在假设更具结构的物品相关性的情况下可以获得更快的学习率。特别地,我们引入了一类新的\emph{块秩}(Block-Rank)基于RUM的模型,其中最优物品被证明仅需O(rϵ2log(n/δ))O(r \epsilon^{-2} \log(n/\delta))个样本即可实现(ϵ,δ)(\epsilon,\delta)-PAC可学习。这改进了通常学习算法已知的O~(nϵ2log(1/δ))\tilde{O}(n\epsilon^{-2} \log(1/\delta))标准样本复杂度界,后者可能未利用物品相关性(rnr \ll n)。我们以匹配的下界(至多对数因子差距)补充了上述样本复杂度,证明了我们分析的正确性。令人惊讶的是,当学习者被迫仅进行两两对决而非更大的子集式查询时,我们也展示了Ω(nϵ2log(1/δ))\Omega(n\epsilon^{-2}\log(1/\delta))的下界。此外,我们将结果扩展到更一般的“\emph{含噪块秩}”(noisy Block-Rank)模型,从而确保我们技术的鲁棒性。总体而言,我们的结果证明了进行子集式查询相对于成对偏好(k=2)(k=2)的优势,我们表明后者在利用相关性方面必然失败。

关键词

引用

@article{arxiv.2202.11795,
  title  = {Exploiting Correlation to Achieve Faster Learning Rates in Low-Rank Preference Bandits},
  author = {Suprovat Ghoshal and Aadirupa Saha},
  journal= {arXiv preprint arXiv:2202.11795},
  year   = {2022}
}

备注

In International Conference on Artificial Intelligence and Statistics, AIStats 2022