中文

融合多数据源的多用户上下文推断

信息检索 2017-03-17 v2 分布式、并行与集群计算

摘要

用户上下文信息(包括用户性别、年龄、婚姻状况、位置等)的推断已被证明对构建上下文感知推荐系统很有价值。然而,现有关于用户上下文推断的普遍研究存在两个缺点:1. 仅关注单一数据源(例如互联网浏览日志或移动通话记录);2. 忽略多个用户上下文之间的相互依赖(例如年龄与婚姻状况之间的相互依赖),这导致了较差的推断性能。为解决该问题,本文中我们首先利用张量外积在特征空间中融合多个数据源,以获得扩展的用户特征表示。随后,以该扩展用户特征表示为输入,我们提出一种称为 MulAProM 的多属性概率模型来推断用户上下文,该模型能够利用它们之间的相互依赖关系。我们的研究基于来自中国上海本地移动运营商的大型电信数据集,包含两个月数据源,即 8000 名移动用户在六个月期间产生的 460 万条通话详细记录和 750 万条数据流量记录。实验结果表明,我们的模型在召回率(recall)、精确率(precision)和 F1 值(F1-measure)方面优于其他模型。

关键词

引用

@article{arxiv.1703.04215,
  title  = {Multiple User Context Inference by Fusing Data Sources},
  author = {Jinliang Xu and Shangguang Wang and Fangchun Yang and Jie Tang},
  journal= {arXiv preprint arXiv:1703.04215},
  year   = {2017}
}

备注

This paper has been withdrawn by the author due to a crucial sign error in some equations and figures