可扩展且感知稀疏性的隐私保护 K-means 聚类及其在欺诈检测中的应用
机器学习
2022-08-15 v1 密码学与安全
摘要
K-means 是实践中应用最广泛的聚类模型之一。由于数据孤岛问题以及对高模型性能的需求,如何为多方联合构建实用且安全的 K-means 已成为工业界许多应用的重要课题。现有相关工作主要分为两类。第一类具有效率优势,但信息泄露带来潜在隐私风险。第二类可证明安全,但效率低下,甚至对大规模数据稀疏场景无能为力。本文提出一种具有三项特性的高效感知稀疏性 K-means 新框架。首先,我们的框架分为与数据无关的离线阶段和快得多的在线阶段,且离线阶段可预计算几乎所有密码学操作。其次,我们在在线与离线阶段均利用向量化技术。第三,我们针对数据稀疏场景采用稀疏矩阵乘法以进一步提升效率。我们在三个合成数据集上进行了综合实验,并将模型部署于真实世界的欺诈检测任务。实验结果表明,与最先进方案相比,我们的模型在运行时间与通信量方面均具竞争力,尤其在稀疏数据集上。
引用
@article{arxiv.2208.06093,
title = {Scalable and Sparsity-Aware Privacy-Preserving K-means Clustering with Application to Fraud Detection},
author = {Yingting Liu and Chaochao Chen and Jamie Cui and Li Wang and Lei Wang},
journal= {arXiv preprint arXiv:2208.06093},
year = {2022}
}
备注
10 pages, 9 figures