差分隐私纵向联邦聚类
密码学与安全
2023-04-03 v2 机器学习
摘要
在许多应用中,多方持有关于同一组用户但属性集互不相交的私有数据,而服务器希望利用这些数据训练模型。为在保护数据主体隐私的同时实现模型学习,我们需要纵向联邦学习(VFL)技术,其中数据方仅共享用于训练模型的信息,而非私有数据。然而,要确保所共享信息在学得准确模型的同时维持隐私颇具挑战。据我们所知,本文提出的算法是首个针对差分隐私纵向联邦 k-means 聚类的实用方案,服务器可借此获得一组具可证明差分隐私保证的全局中心。我们的算法假设一个不可信的中心服务器,聚合来自本地数据方的差分隐私局部中心与成员编码。它基于所接收信息构建加权网格作为全局数据集的概要。最终中心通过在加权网格上运行任意 k-means 算法生成。我们的网格权重估计方法使用了一种新颖、轻量且基于 Flajolet-Martin 草图的差分隐私集合交基数估计算法。为在多于两方数据方的设定中提升估计精度,我们进一步提出一种精炼版权重估计算法与参数调优策略,以使最终 k-means 效用接近中心私有设定下的水平。我们给出了由算法计算的簇中心的理论效用分析与实验评估结果,表明我们的方法在理论与经验上均优于基于现有技术的两个基线。
引用
@article{arxiv.2208.01700,
title = {Differentially Private Vertical Federated Clustering},
author = {Zitao Li and Tianhao Wang and Ninghui Li},
journal= {arXiv preprint arXiv:2208.01700},
year = {2023}
}