基于选择数据的高效精确 Top-$K$ 恢复
机器学习
2023-03-16 v1 信息检索
摘要
排序学习(learning to rank)与选择建模(choice modeling)的交叉是一个活跃的研究领域,在电子商务、信息检索和社会科学中有应用。在推荐系统等一些应用中,统计学家主要感兴趣的是利用被动收集的离散选择数据(即用户从多个项目的集合中挑选一个项目),从大量项目中尽可能高效地恢复排名最前的项目集合。受这一实际考量驱动,我们提出基于选择的 Borda 计数算法(choice-based Borda count algorithm),作为一种快速而准确的用于 top 恢复的排序算法,即正确识别所有前 个项目。我们证明,在广泛的随机效用模型类别下,基于选择的 Borda 计数算法对 top- 恢复具有最优样本复杂度。我们证明在极限情况下,该算法产生与常用的极大似然估计(Maximum Likelihood Estimate)方法相同的 top- 估计,但前者的速度与简洁性在实践中带来显著优势。在合成与真实数据集上的实验表明,该计数算法在准确性上与常用排序算法相当,同时速度快几个数量级。
引用
@article{arxiv.2206.11995,
title = {Efficient and Accurate Top-$K$ Recovery from Choice Data},
author = {Duc Nguyen},
journal= {arXiv preprint arXiv:2206.11995},
year = {2023}
}