随机擦除 vs. 模型反向: 有效防御还是假希望?
机器学习
2025-08-07 v3 密码学与安全
计算机视觉与模式识别
摘要
模型反向(MI)攻击通过从机器学习模型重建私人训练数据构成显著隐私威胁。虽然现有防御主要集中在模型层面,但数据对 MI 鲁棒性的影响仍基本未被探索。本文我们探索随机擦除(RE),这是一种用于提高模型在遮挡下泛化的技术,发现其作为防御 MI 攻击的意想不到的有效性。具体而言,我们的新型特征空间分析表明,采用 RE 训练的模型在 MI 重建图像的特征与私人数据特征之间引入了显著差异。同时,私人图像的特征仍与其他类别保持区分度,并与不同分类区域良好分离。这些效应共同降低了 MI 重建质量和攻击准确度,同时保持合理的自然准确度。进一步,我们探讨了 RE 的两个关键属性,包括部分擦除和随机位置。部分擦除可防止模型在训练期间观察整个对象。我们发现这对 MI 有显著影响,即其旨在重建整个对象。擦除的随机位置在实现强隐私-效用权衡方面起着关键作用。我们的发现突显 RE 作为一种简单而有效的防御机制,可轻易集成到现有隐私保护技术中。广泛的实验在 37 个设置中表明,我们的方法在隐私-效用权衡方面实现了最先进(SOTA)性能。结果在不同 MI 攻击、网络架构和攻击配置下均显示出对现有方法的优势。首次在某些配置下实现攻击准确度显著下降且不降低效用。
引用
@article{arxiv.2409.01062,
title = {Random Erasing vs. Model Inversion: A Promising Defense or a False Hope?},
author = {Viet-Hung Tran and Ngoc-Bao Nguyen and Son T. Mai and Hans Vandierendonck and Ira Assent and Alex Kot and Ngai-Man Cheung},
journal= {arXiv preprint arXiv:2409.01062},
year = {2025}
}
备注
Accepted in Transactions on Machine Learning Research (TMLR). First two authors contributed equally