中文

基于掩码数据的计算:一种提升大数据真实性的高性能方法

密码学与安全 2015-05-26 v1 天体物理仪器与方法 数据库 信息检索

摘要

数据与用户之间日益扩大的鸿沟呼唤创新工具来应对大数据在体量、速度和多样性方面的挑战。除了大数据的这三个标准V之外,新兴的第四个“V”是真实性,它涉及数据的机密性、完整性和可用性。确保数据真实性的传统密码技术开销过大,难以应用于大数据。本文介绍了一种称为“基于掩码数据的计算”(CMD)的新技术,它允许直接在掩码数据上执行计算,并确保只有授权接收者才能解掩码数据,从而提升数据真实性。利用关联数组的稀疏线性代数,CMD可以在支持对掩码数据进行广泛线性代数运算的同时,其开销远低于其他方法。对稀疏运算有强力支持的数据库(如SciDB或Apache Accumulo)非常适合这种技术。文中展示了CMD在复杂DNA匹配算法以及社交媒体数据上的数据库操作中的应用示例。

关键词

引用

@article{arxiv.1406.5751,
  title  = {Computing on Masked Data: a High Performance Method for Improving Big Data Veracity},
  author = {Jeremy Kepner and Vijay Gadepally and Pete Michaleas and Nabil Schear and Mayank Varia and Arkady Yerukhimovich and Robert K. Cunningham},
  journal= {arXiv preprint arXiv:1406.5751},
  year   = {2015}
}

备注

to appear in IEEE High Performance Extreme Computing 2014 (ieee-hpec.org)