利用相关性在低秩偏好老虎机中实现更快学习率
机器学习
2022-02-25 v1 人工智能
摘要
我们引入了基于随机效用选择模型(RUMs)的\emph{相关偏好老虎机}(Correlated Preference Bandits)问题,其目标是通过在线子集式偏好反馈从给定的个物品池中识别出最优物品。我们研究具有简单相关结构(例如低秩)的模型是否能够带来更快的学习率。虽然我们表明该问题对于一般“低秩”选择模型可能无法求解,但在假设更具结构的物品相关性的情况下可以获得更快的学习率。特别地,我们引入了一类新的\emph{块秩}(Block-Rank)基于RUM的模型,其中最优物品被证明仅需个样本即可实现-PAC可学习。这改进了通常学习算法已知的标准样本复杂度界,后者可能未利用物品相关性()。我们以匹配的下界(至多对数因子差距)补充了上述样本复杂度,证明了我们分析的正确性。令人惊讶的是,当学习者被迫仅进行两两对决而非更大的子集式查询时,我们也展示了的下界。此外,我们将结果扩展到更一般的“\emph{含噪块秩}”(noisy Block-Rank)模型,从而确保我们技术的鲁棒性。总体而言,我们的结果证明了进行子集式查询相对于成对偏好的优势,我们表明后者在利用相关性方面必然失败。
引用
@article{arxiv.2202.11795,
title = {Exploiting Correlation to Achieve Faster Learning Rates in Low-Rank Preference Bandits},
author = {Suprovat Ghoshal and Aadirupa Saha},
journal= {arXiv preprint arXiv:2202.11795},
year = {2022}
}
备注
In International Conference on Artificial Intelligence and Statistics, AIStats 2022