Trap-MID:基于后门的模型反演攻击防御
密码学与安全
2024-11-26 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
模型反演(MI)攻击通过从训练良好的模型中恢复训练数据分布,对深度神经网络隐私构成重大威胁。现有防御常依赖正则化技术减少信息泄露,但仍脆弱于近期攻击。本文提出基于后门的模型反演防御(Trap-MID)以误导 MI 攻击。将一个后门集成到模型中,使其在输入注入相应触发器时预测特定标签。因此,该后门信息成为 MI 攻击的“捷径”,诱使其提取后门触发器而非私有数据。我们从理论上分析了后门有效性与自然性对欺骗 MI 攻击的影响。此外,实验表明 Trap-MID 在无需额外数据或大量计算开销的情况下,对多种 MI 攻击实现了最先进的防御性能。我们的源代码公开可用于 https://github.com/ntuaislab/Trap-MID。
引用
@article{arxiv.2411.08460,
title = {Trap-MID: Trapdoor-based Defense against Model Inversion Attacks},
author = {Zhen-Ting Liu and Shang-Tse Chen},
journal= {arXiv preprint arXiv:2411.08460},
year = {2024}
}
备注
Accepted by Neural Information Processing Systems (NeurIPS) 2024