Apache Hive 与 Spark 的集成
数据库
2019-01-21 v1
摘要
本文档描述了所采用的解决方案,这些方案源于在最著名的分布式 SQL 与 NoSQL 存储系统之间传输大量信息以利用它们各自特性执行分析和/或修改操作的需求。该目标通过使用 Spark 引擎并研究和使用 Hortonworks 提供的开源库“Hive Warehouse Connector”得以实现,该库提供了 Hive 与 Spark 之间新的互操作特性。选择这些 API 是为了利用 Spark 通过 Spark-Sql 库进行的分布式计算,以允许对 Network Contacts 系统工程团队所选数据库进行快速读写,并使存储在 Ambari 集群之外的信息可供查询。
引用
@article{arxiv.1901.06238,
title = {Integrazione di Apache Hive con Spark},
author = {Michele Gentile and Massimiliano Morrelli},
journal= {arXiv preprint arXiv:1901.06238},
year = {2019}
}
备注
in Italian