为何公开预训练对隐私模型训练必不可少?
机器学习
2023-02-21 v1
摘要
在基准语言与视觉任务上训练模型的隐私-效用权衡中,使用公开数据预训练带来的显著改进已被广泛报道。这部分归因于迁移学习的益处,这也是非隐私场景下预训练的标准动机。然而,与隐私场景相比,非隐私场景下通过预训练所获改进的鲜明对比表明,驱动这些增益的背后可能存在更深层、独特的原因。为解释这一现象,我们假设模型训练的非凸损失景观迫使优化算法经历两个阶段。第一阶段,算法需要在损失景观中选择一个好的“盆地”。第二阶段,算法在该盆地内求解一个简单的优化问题。前者用私有数据更难解决,而后者由于分布偏移或数据稀缺,用公开数据更难解决。基于这一直觉,我们提供了理论构造,可证明地展示了有公开预训练与无公开预训练的私有训练之间的分离。此外,在 CIFAR10 和 LibriSpeech 上的系统性实验为我们的假设提供了支持性证据。
引用
@article{arxiv.2302.09483,
title = {Why Is Public Pretraining Necessary for Private Model Training?},
author = {Arun Ganesh and Mahdi Haghifam and Milad Nasr and Sewoong Oh and Thomas Steinke and Om Thakkar and Abhradeep Thakurta and Lun Wang},
journal= {arXiv preprint arXiv:2302.09483},
year = {2023}
}