中文

按需大数据集成:面向可复现科学研究的混合ETL方法

数据库 2018-04-25 v1

摘要

科学研究需要以互联网规模访问、分析和共享分布在各种异构数据源中的数据。急切式ETL(eager ETL)过程将构建集成数据仓库作为其第一步,从数据源完整地集成并加载数据。对于需要访问来自非常庞大且通常数量众多的分布式数据源的数据的科学研究而言,该过程的引导效率不高。惰性ETL(lazy ETL)过程仅加载元数据,但仍是急切式的。惰性ETL在引导方面更快。然而,由于事先已有全部数据可用,对急切式ETL集成数据仓库的查询执行更快。本文提出一种新颖的用于科学数据集成的ETL方法,作为急切式与惰性ETL方法的混合,并同时应用于数据及元数据。由此,混合ETL支持从数据源增量式集成与加载元数据和数据。我们引入人在回路(human-in-the-loop)方法以增强混合ETL,通过由用户查询驱动的选择性数据集成以及用户间集成数据的共享来实现。我们在原型平台Obidos中实现了该混合ETL方法,并在医学研究数据共享背景下对其进行了评估。通过其选择性的数据与元数据加载,同时将集成数据存储在可扩展的集成数据仓库中,Obidos在科学研究数据集成与共享方面优于急切式ETL和惰性ETL两种方法。

关键词

引用

@article{arxiv.1804.08985,
  title  = {On-Demand Big Data Integration: A Hybrid ETL Approach for Reproducible Scientific Research},
  author = {Pradeeban Kathiravelu and Ashish Sharma and Helena Galhardas and Peter Van Roy and Luıs Veiga},
  journal= {arXiv preprint arXiv:1804.08985},
  year   = {2018}
}

备注

Pre-print Submitted to the DMAH Special Issue of the Springer DAPD Journal