中文

Peacock:面向工业应用的长尾主题特征学习

信息检索 2015-12-08 v3 分布式、并行与集群计算

摘要

隐含狄利克雷分配(LDA)是一种在学术界流行的主题建模技术,但在工业界,尤其是在涉及搜索引擎和在线广告系统的大规模应用中,其使用率较低。一个主要的根本原因是所使用的主题模型规模太小,难以发挥作用;例如,文献中报道的一些最大 LDA 模型最多只有 10310^3 个主题,难以覆盖长尾语义词集。在本文中,我们表明主题数量是能够显著提升主题建模系统实用性的关键因素。具体而言,我们展示了从 10910^9 搜索查询中推断出的具有至少 10510^5 个主题的“大型”LDA 模型,能够在服务于数亿用户的工业搜索引擎和在线广告系统中实现显著改进。我们开发了一种名为 Peacock 的新型分布式系统,用于从大数据中学习大型 LDA 模型。Peacock 的主要特性包括分层分布式架构、实时预测和主题去重。我们通过实证证明,Peacock 系统能够通过高度可扩展的 LDA 主题模型为多种工业应用提供显著效益。

关键词

引用

@article{arxiv.1405.4402,
  title  = {Peacock: Learning Long-Tail Topic Features for Industrial Applications},
  author = {Yi Wang and Xuemin Zhao and Zhenlong Sun and Hao Yan and Lifeng Wang and Zhihui Jin and Liubin Wang and Yang Gao and Ching Law and Jia Zeng},
  journal= {arXiv preprint arXiv:1405.4402},
  year   = {2015}
}

备注

23 pages, 11 figures, ACM Transactions on Intelligent Systems and Technology, 2015