数据也是我的:面向多用户训练样本数据集的私有机器学习
机器学习
2025-03-06 v1
摘要
本文开创性地研究了具有用户级差分隐私(DP)的模型训练算法,其中每个样本可能归属于多个用户,我们称之为多归属模型。首先,我们在多归属模型下给出了用户级差分隐私的精心选择的定义。多归属模型中的训练通过求解贡献界定问题得以实现,即为每个用户关联有限数量样本的数据子集选择问题。本文为贡献界定问题提出了一种贪心基线算法。随后,我们在合成逻辑回归任务和 Transformer 训练任务上对该算法进行了实证研究,包括研究使用不同技术和标准优化所选子集的基线算法变体。我们发现基线算法在大多数设置下仍与其变体具有竞争力,并建立了对贡献界定问题解中固有的偏差-方差权衡实际重要性的更好理解。
引用
@article{arxiv.2503.03622,
title = {It's My Data Too: Private ML for Datasets with Multi-User Training Examples},
author = {Arun Ganesh and Ryan McKenna and Brendan McMahan and Adam Smith and Fan Wu},
journal= {arXiv preprint arXiv:2503.03622},
year = {2025}
}