基于差分隐私合成孪生数据的分布式数据协同学习
机器学习
2023-08-10 v1 密码学与安全
摘要
考虑这样一种场景:多个持有敏感数据的参与方旨在协同学习总体层面的统计量,但无法汇集这些敏感数据集。我们提出一个框架,其中每个参与方共享其数据的差分隐私合成孪生。我们研究了在 UK Biobank 的真实世界健康数据上组合此类合成孪生数据集进行协同学习的可行性。我们发现,通过共享合成数据参与协同学习的参与方,相比仅使用本地数据,能获得目标统计量更精确的估计。这一发现也适用于小样本异质数据集这一困难情形。此外,参与的方越多,改进越大且越一致。最后,我们发现数据共享尤其能帮助那些包含代表性不足群体的数据的参与方,对这些群体进行更好校正的分析。基于我们的结果,我们得出结论:共享合成孪生是一种在不违反隐私约束的前提下实现从敏感数据学习的可行方法,即便单个数据集很小或不能很好代表总体。分布式敏感数据的情形常常是生物医学研究中的瓶颈,我们的研究表明可通过隐私保护协同学习方法来缓解。
引用
@article{arxiv.2308.04755,
title = {Collaborative Learning From Distributed Data With Differentially Private Synthetic Twin Data},
author = {Lukas Prediger and Joonas Jälkö and Antti Honkela and Samuel Kaski},
journal= {arXiv preprint arXiv:2308.04755},
year = {2023}
}