中文

面向基于云的企业搜索解决方案的非结构化大数据隐私保护聚类

分布式、并行与集群计算 2022-06-10 v2 密码学与安全 数据库 信息检索

摘要

基于云的企业搜索服务(如 Amazon Kendra)通过为大数据拥有者提供便捷的企业大数据集搜索解决方案,对其产生了巨大吸引力。然而,处理机密大数据(例如凭证文件)的个人和企业由于对数据隐私的合理担忧,不愿完全接受此类服务。已有研究探索了基于客户端加密的解决方案以缓解隐私担忧。尽管如此,此类解决方案阻碍了数据处理,尤其是聚类,而聚类对于处理各种形式的大数据至关重要。例如,聚类对于缩小搜索空间和对大数据集执行实时搜索操作具有关键作用。为了克服加密大数据聚类中的障碍,我们针对三种形式的非结构化加密大数据集,即静态、半动态和动态数据集,提出了隐私保护聚类方案。为保护数据隐私,所提出的聚类方案基于数据的统计特征运行,并确定(A)合适的簇数量和(B)每个簇的适当内容。在三个不同数据集上评估聚类方案的实验结果表明,与其他加密数据聚类方案相比,簇的连贯性提升了 30% 至 60%。将聚类方案应用于隐私保护企业搜索系统,可使其搜索时间减少高达 78%,同时搜索准确率提升高达 35%。

关键词

引用

@article{arxiv.2005.11317,
  title  = {Privacy-Preserving Clustering of Unstructured Big Data for Cloud-Based Enterprise Search Solutions},
  author = {SM Zobaed and Mohsen Amini Salehi},
  journal= {arXiv preprint arXiv:2005.11317},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:1908.04960