中文

一种用于高效生成合成大数据集的“即时”框架

分布式、并行与集群计算 2019-03-19 v1

摘要

在越来越多的行业中,收集、分析大量数据并从中获取洞察已成为常态。数据分析技术(如机器学习)是用于分析这些海量数据的强大工具。出于多种原因,合成数据集被常规地用于训练和开发此类数据分析方法:生成比现有数据更大的数据集、生成多样化数据集、在含敏感信息的数据集中保护匿名性等。在处理大型数据集时,数据的处理、传输和存储是一个关键问题。本文提出了一种“即时”框架,用于生成适用于这些数据分析方法的大型合成数据集,该框架在计算上高效且可应用于多样化问题。文中给出了所提框架的一个应用示例,并对其计算效率进行了数学分析,证明了其有效性。

关键词

引用

@article{arxiv.1903.06798,
  title  = {An "On The Fly" Framework for Efficiently Generating Synthetic Big Data Sets},
  author = {Karl Mason and Sadegh Vejdan and Santiago Grijalva},
  journal= {arXiv preprint arXiv:1903.06798},
  year   = {2019}
}

备注

13 pages, 3 figures