中文

社交媒体流中的模因聚类

社会与信息网络 2017-03-07 v1 计算机与社会 机器学习 物理与社会

摘要

社交媒体内容聚类问题具有广泛的应用,包括讨论主题识别、事件检测和内容推荐。本文我们描述了一个用于社交媒体(特别是 Twitter)中模因在线检测和聚类的流式框架。一个称为原模因检测的预聚类过程首先分离出推文携带的原子信息单元。随后,基于多种相似性度量对原模因进行聚合,以获得作为反映实际概念或讨论主题的凝聚推文群的模因。该聚类算法考虑了数据和元数据的多个维度,包括自然语言、社交网络以及信息扩散模式。因此,我们的系统能够构建语义、结构和主题上相关的推文簇。聚类过程基于一种包含记忆机制的在线 K-means 变体,该机制用于“遗忘”旧模因并随时间用新模因替换它们。我们使用 Twitter 热门话题数据集对我们的框架进行了评估。在一周的时间内,我们系统地检验了算法是否能够恢复热门标签。我们表明,所提出的方法优于仅使用内容特征的基线算法,以及一种假设完全了解底层关注者网络的最新事件检测方法。最后,我们表明我们的在线学习框架是灵活的,因为它独立于所采用的聚类算法,并且最适合在流式场景中工作。

关键词

引用

@article{arxiv.1411.0652,
  title  = {Clustering memes in social media streams},
  author = {Mohsen JafariAsbagh and Emilio Ferrara and Onur Varol and Filippo Menczer and Alessandro Flammini},
  journal= {arXiv preprint arXiv:1411.0652},
  year   = {2017}
}

备注

25 pages, 8 figures, accepted on Social Network Analysis and Mining (SNAM). The final publication is available at Springer via http://dx.doi.org/10.1007/s13278-014-0237-x