中文

通过集成反演从多样化机器学习模型中重建训练数据

机器学习 2021-11-09 v1 人工智能 计算机视觉与模式识别

摘要

模型反演(Model Inversion, MI)是指攻击者滥用对训练好的机器学习(Machine Learning, ML)模型的访问权限,试图推断其原始训练数据中的敏感信息,已引起越来越多的研究关注。在 MI 过程中,受攻击的训练模型(MUA)通常被冻结并用于引导生成器(如生成对抗网络(Generative Adversarial Network, GAN))的训练,以重建该模型原始训练数据的分布。这可能导致原始训练样本的泄露,若训练数据包含个人可识别信息(Personally Identifiable Information, PII),则数据集主体的隐私将面临风险。因此,深入探究 MI 技术的潜力对于发展相应的防御技术至关重要。基于单一模型高质量重建训练数据具有挑战性。然而,现有 MI 文献未探索联合针对多个模型,这可能为攻击者提供额外信息与多样化视角。我们提出集成反演技术,通过训练一个由共享主体或实体的若干训练模型组成的集合(或集成)所约束的生成器,来估计原始训练数据的分布。与单一 ML 模型的 MI 相比,该技术在生成具有数据集实体可区分特征的样本质量上带来显著提升。我们在无任何数据集的情况下取得高质量结果,并展示了如何利用与假定训练数据相似的辅助数据集来改善结果。我们深入研究了集成中模型多样性的影响,并利用额外约束鼓励重建样本的尖锐预测与高激活,从而实现训练图像更准确的重建。

关键词

引用

@article{arxiv.2111.03702,
  title  = {Reconstructing Training Data from Diverse ML Models by Ensemble Inversion},
  author = {Qian Wang and Daniel Kurz},
  journal= {arXiv preprint arXiv:2111.03702},
  year   = {2021}
}

备注

9 pages, 8 figures, WACV 2022