中文

面向大规模线性二部排序的样本点对与样本点主动采样

机器学习 2017-08-25 v1 信息检索

摘要

二部排序是一个基本的排序问题,其目标是学习将相关实例排在不相关实例之前。二部排序的成对方法构造二次数量级的样本对来求解问题,这对于大规模数据集是不可行的。逐点方法虽然更高效,但通常导致较差的性能。也就是说,难以同时准确且高效地进行二部排序。在本文中,我们在成对方法内开发了一种新颖的主动采样方案,以高效地进行二部排序。该方案受主动学习启发,在训练期间仅聚焦于众多样本对的一个小子集,即可达到具有竞争力的排序性能。此外,我们提出了一个通用的排序与分类联合(CRC)框架,以准确地进行二部排序。该框架统一了逐点方法和成对方法,其思想简单地将每个实例点视为一个伪样本对。在 14 个真实的大规模数据集上的实验表明,所提出的 CRC 内主动采样算法与线性支持向量机结合使用时,在准确性和效率方面通常优于最先进的逐点和成对排序方法。

关键词

引用

@article{arxiv.1708.07336,
  title  = {Active Sampling of Pairs and Points for Large-scale Linear Bipartite Ranking},
  author = {Wei-Yuan Shen and Hsuan-Tien Lin},
  journal= {arXiv preprint arXiv:1708.07336},
  year   = {2017}
}

备注

a shorter version was presented in ACML 2013