立场:关于大规模公开预训练的差分隐私学习之若干考量
机器学习
2024-07-18 v3 密码学与安全
机器学习
摘要
差分隐私机器学习的性能可通过利用在非隐私大规模公开数据集上预训练模型的迁移学习能力而显著提升。我们批判性审视了这一方法。我们主要质疑将大规模网络抓取数据集的使用视为差分隐私保护是否恰当。我们警示,将此类基于网络数据预训练的模型公开宣称为“隐私”的,可能带来危害并侵蚀公众对差分隐私作为有意义隐私定义的信任。除使用公开数据的隐私考量外,我们进一步质疑该范式的效用。我们审视现有机器学习基准是否适于衡量预训练模型对敏感领域的泛化能力,而敏感领域可能在公开网络数据中代表性不足。最后,我们注意到预训练对现有最大模型影响尤为显著——这些模型规模之大以致终端用户无法在自有设备上运行。因此,当下部署此类模型对隐私或是净损失,因其要求将(私有)数据外包给算力更强的第三方。我们最后讨论了在公开预训练日益流行且强大的背景下,私有学习领域的潜在前进路径。
引用
@article{arxiv.2212.06470,
title = {Position: Considerations for Differentially Private Learning with Large-Scale Public Pretraining},
author = {Florian Tramèr and Gautam Kamath and Nicholas Carlini},
journal= {arXiv preprint arXiv:2212.06470},
year = {2024}
}
备注
Full and unabridged version of paper ICML 2024