中文

基于二值码的大规模 Top-N 推荐候选生成

信息检索 2019-09-13 v1

摘要

从大规模语料库中生成 Top-N 推荐在计算上代价高昂,难以规模化执行。工业界常采用候选生成与重排序相结合的方法来缓解效率问题。然而,此类方案对完整排序的近似程度(或需要多少候选才能达到良好近似),以及如何系统性地高效生成高质量候选,仍有待充分研究。本文旨在通过提出一种基于候选生成与重排序的框架(CIGAR)来探究这些问题:该框架首先学习保偏好的二值嵌入以构建哈希表检索候选,然后利用以候选为导向的目标函数,通过实值排序模型学习对候选重排序。我们在多个包含数百万用户/物品、数亿交互的大规模真实数据集上进行了综合研究。结果表明,CIGAR 相比 SOTA 推荐模型显著提升了 Top-N 准确率,同时将查询时间降低了数个数量级。我们希望本工作能引起更多对推荐系统中候选生成问题的关注。

关键词

引用

@article{arxiv.1909.05475,
  title  = {Candidate Generation with Binary Codes for Large-Scale Top-N Recommendation},
  author = {Wang-Cheng Kang and Julian McAuley},
  journal= {arXiv preprint arXiv:1909.05475},
  year   = {2019}
}

备注

accepted to CIKM'19 as long paper