面向社交网络的多语言数据处理:基于 Hadoop-Spark 生态系统的实现
分布式、并行与集群计算
2025-04-22 v1
摘要
本文探讨了如何在 Hadoop-Spark 生态系统中采用多语言方法处理社交媒体数据,集成各种计算和存储技术,如 Hive、HBase 和 GraphX。我们讨论了处理社交网络数据所涉及的具体任务,包括计算用户影响力、统计消息中出现频率最高的术语以及识别用户和群组之间的社交关系。我们进行了一系列实证性能评估,重点在 Hadoop-Spark 集群中执行所选任务并衡量其执行时间。这些发现提供了对生态系统工具性能效率的详细定量分析。我们指出,Hadoop-Spark 生态系统工具在推动社交网络及相关领域的研究方面具有巨大的潜力。
引用
@article{arxiv.2504.14314,
title = {Towards Polyglot Data Processing in Social Networks using the Hadoop-Spark ecosystem},
author = {Antony Seabra and Sergio Lifschitz},
journal= {arXiv preprint arXiv:2504.14314},
year = {2025}
}
备注
6th International Conference on Artificial Intelligence and Big Data (AIBD 2025), January 18 ~ 19, 2025, Zurich, Switzerland Volume Editors : David C. Wyld, Dhinaharan Nagamalai (Eds) ISBN : 978-1-923107-48-9