中文

Apache Hive 与 Spark 的集成

数据库 2019-01-21 v1

摘要

本文档描述了所采用的解决方案,这些方案源于在最著名的分布式 SQL 与 NoSQL 存储系统之间传输大量信息以利用它们各自特性执行分析和/或修改操作的需求。该目标通过使用 Spark 引擎并研究和使用 Hortonworks 提供的开源库“Hive Warehouse Connector”得以实现,该库提供了 Hive 与 Spark 之间新的互操作特性。选择这些 API 是为了利用 Spark 通过 Spark-Sql 库进行的分布式计算,以允许对 Network Contacts 系统工程团队所选数据库进行快速读写,并使存储在 Ambari 集群之外的信息可供查询。

关键词

引用

@article{arxiv.1901.06238,
  title  = {Integrazione di Apache Hive con Spark},
  author = {Michele Gentile and Massimiliano Morrelli},
  journal= {arXiv preprint arXiv:1901.06238},
  year   = {2019}
}

备注

in Italian