中文

通过结合 doc2vec 的混合过滤学习连续用户表示

信息检索 2018-01-03 v1 人工智能 计算与语言

摘要

在线广告生态中的参与者正艰难获取精准定向所需的用户数据。受众相似建模有潜力缓解此问题,但模型性能强烈依赖于可用数据的数量与质量。为最大化相似建模算法的预测性能,我们提出两种利用近期神经概率语言模型算法 doc2vec 的新型混合过滤技术。我们将这些方法应用于来自大型移动广告交易平台的数据,以及从 Apple App Store 和 Google Play Store 获取的附加应用元数据。首先,我们通过用户的 app 使用历史和应用描述对用户建模(user2vec)。其次,我们在模型训练中融入额外的用户和应用相关元数据,为该模型引入上下文感知(context2vec)。我们的发现有三方面:(1)user2vec 所提供推荐的质量显著高于当前最先进技术。(2)通过结合 doc2vec 的混合过滤生成的用户表示,被证明是相似建模监督机器学习模型中极具价值的特征。这代表了神经概率语言模型( specifically doc2vec)的混合过滤用户模型在相似建模中的首次应用。(3)在 doc2vec 模型训练过程中融入上下文元数据以引入上下文感知,对性能有正向影响,且优于将该数据直接作为特征纳入下游监督模型。

关键词

引用

@article{arxiv.1801.00215,
  title  = {Learning Continuous User Representations through Hybrid Filtering with doc2vec},
  author = {Simon Stiebellehner and Jun Wang and Shuai Yuan},
  journal= {arXiv preprint arXiv:1801.00215},
  year   = {2018}
}

备注

10 pages