中文

面向二元响应的并行矩阵分解

机器学习 2012-03-26 v1 应用统计

摘要

预测用户对物品的亲和度是内容优化、计算广告等应用中的重要问题。虽然双线性随机效应模型(矩阵分解)在通过高斯响应模型对显式评分数据进行RMSE最小化时提供了最先进的性能,但将其应用于不平衡的二元响应数据会带来额外的挑战,我们在本文中仔细研究了这些挑战。许多应用中的数据通常由用户的隐式响应组成,这些响应通常是二元的——点击或不点击物品;目标是预测点击率,通常与其他度量结合以计算效用,从而在推荐系统运行时对物品进行排序。由于隐式性质,此类数据通常比显式评分数据大得多,并且通常具有不平衡分布,只有一小部分点击事件,使得准确的点击率预测变得困难。在本文中,我们解决了两个问题。首先,我们表明,与基于自适应拒绝抽样的新方法相比,先前用二元数据估计双线性随机效应模型的技术准确性较低,尤其对于不平衡响应。其次,我们使用Map-Reduce范式开发了一个并行的双线性随机效应模型拟合框架,可扩展到大规模数据集。我们的并行算法基于“分而治之”策略并结合集成方法。通过在基准MovieLens数据、小型Yahoo!首页数据集和包含800万用户和10亿二元观测值的大型Yahoo!首页数据集上的实验,我们表明,需要仔细处理二元响应以及可识别性问题才能实现良好的点击率预测性能,并且所提出的自适应拒绝采样器以及分区和集成技术显著提高了模型性能。

关键词

引用

@article{arxiv.1203.5124,
  title  = {Parallel Matrix Factorization for Binary Response},
  author = {Rajiv Khanna and Liang Zhang and Deepak Agarwal and Beechung Chen},
  journal= {arXiv preprint arXiv:1203.5124},
  year   = {2012}
}