中文

面向模型反演攻击的样本级评估与生成框架

机器学习 2025-02-27 v1 密码学与安全

摘要

模型反演(MI)攻击通过重构神经网络的训练数据集来构成机器学习中的重大隐私担忧。近期的MI攻击已能够重建逼真的标签级别私人数据,例如从所有标记为某人的训练图像中重建该人员的整体外观。超越标签级别隐私,本文表明样本级别隐私——即单个目标样本的私人信息——在MI文献中同样重要但鲜有被探讨,这是由于现有评估指标的局限性所致。为填补这一空白,本研究引入一种针对训练样本分析的新型指标,即多样性与距离复合得分(DDCS),该指标通过包含各种MI攻击属性来评估每个训练样本的重建保真度,从而提高了样本级别隐私评估的精度。借助DDCS作为新的评估视角,我们观察到许多训练样本即使面对最先进的MI攻击也保持鲁鲁性。因此,我们进一步提出一种迁移学习框架,通过整合熵损失和自然梯度下降来增强MI攻击者的生成能力。广泛实验验证了本框架在包括DDCS、覆盖率和FID等多个指标上的有效性。最后,我们展示DDCS也可用于MI防御,通过无监督方式识别易受MI攻击的样本。

关键词

引用

@article{arxiv.2502.19070,
  title  = {A Sample-Level Evaluation and Generative Framework for Model Inversion Attacks},
  author = {Haoyang Li and Li Bai and Qingqing Ye and Haibo Hu and Yaxin Xiao and Huadi Zheng and Jianliang Xu},
  journal= {arXiv preprint arXiv:2502.19070},
  year   = {2025}
}

备注

Accepted to be appeared in 39th Annual AAAI Conference on Artificial Intelligence (AAAI-25)