中文

高维社交媒体数据流的并行聚类

分布式、并行与集群计算 2017-03-07 v1 数据库 社会与信息网络

摘要

我们介绍了 Cloud DIKW,这是一个支持通过集成并行批处理和流处理进行科学发现的分析环境,并将其应用于一个典型的领域应用:社交媒体数据流聚类。最近的工作表明,通过使用反映文本内容和社交网络信息的高维向量来表示数据点,可以生成高质量的聚类。由于相似度计算的高成本,即使是单遍算法的顺序实现也无法跟上现实世界流的速度。本文介绍了我们通过并行化来满足实时社交流聚类约束的努力。我们专注于两个系统级问题。大多数流处理引擎(如 Apache Storm)以有向无环图的形式组织分布式工作节点,使得动态同步并行工作节点的状态变得困难。我们通过使用发布 - 订阅(pub-sub)消息系统创建单独的同步通道来解决这一挑战。由于高维向量的稀疏性,随着新数据点被分配给聚类,质心的大小迅速增长。直接广播聚类质心的传统同步方式变得过于昂贵,限制了并行算法的可扩展性。我们通过仅通信聚类的动态变化而非整个质心向量来解决这个问题。我们的 Cloud DIKW 算法能够以 96 路并行实时处理 Twitter 10% 的数据流。通过对 Cloud DIKW 的自然改进,包括我们在 Harp 项目中开发的先进集体通信技术,我们将能够以 1000 路并行实时处理完整的 Twitter 流。我们对强大通用软件子系统的使用将使许多其他需要集成流式和批量数据分析的应用成为可能。

关键词

引用

@article{arxiv.1502.00316,
  title  = {Parallel clustering of high-dimensional social media data streams},
  author = {Xiaoming Gao and Emilio Ferrara and Judy Qiu},
  journal= {arXiv preprint arXiv:1502.00316},
  year   = {2017}
}

备注

IEEE/ACM CCGrid 2015: 15th IEEE/ACM International Symposium on Cluster, Cloud and Grid Computing, 2015