TMI!微调模型从其预训练数据中泄露隐私信息
机器学习
2024-10-18 v3 密码学与安全
摘要
迁移学习已成为机器学习中日益流行的技术,作为利用为某一任务训练的预训练模型来辅助构建相关任务的微调模型的方法。这一范式在机器学习方面尤为流行,其中预训练模型被视为公开,仅微调数据被视为敏感。然而,有理由相信用于预训练的数据仍是敏感的,因此理解微调模型泄露多少关于预训练数据的信息至关重要。本工作中我们提出一种新的成员推断威胁模型,其中 adversary 仅能访问微调模型并希望推断预训练数据的成员关系。为实现该威胁模型,我们实现了一种基于元分类器的新型攻击,其利用了记忆的预训练样本对下游任务预测的影响。我们在多个迁移学习设定(包括使用差分隐私的微调)下对视觉与自然语言任务评估。通过评估,我们发现可利用对微调模型的查询访问成功推断预训练样本的成员关系。的开源实现见GitHub:https://github.com/johnmath/tmi-pets24。
引用
@article{arxiv.2306.01181,
title = {TMI! Finetuned Models Leak Private Information from their Pretraining Data},
author = {John Abascal and Stanley Wu and Alina Oprea and Jonathan Ullman},
journal= {arXiv preprint arXiv:2306.01181},
year = {2024}
}