针对迁移学习的模型反演攻击:在无法访问模型的情况下反演模型
密码学与安全
2022-03-15 v1 人工智能
摘要
迁移学习是一种重要方法,可生成预训练教师模型,用于快速构建专门的学生模型。然而,近期关于迁移学习的研究发现其易受多种攻击,例如误分类与后门攻击。但迁移学习是否易受模型反演攻击仍不明确。对迁移学习方案发起模型反演攻击具有挑战性:学生模型不仅隐藏其结构参数,且对手无法访问它。因此,当以某学生模型为目标时,现有模型反演攻击的白盒与黑盒版本均告失败。白盒攻击因需要目标模型参数而失败;黑盒攻击因依赖对目标模型反复查询而失败。但这未必意味着迁移学习模型可免遭模型反演攻击。为此,本文以两种新颖攻击方法开启针对迁移学习方案的模型反演攻击研究。二者均为不依赖查询目标学生模型的黑盒攻击,适用于不同场景。第一种方法中,对手拥有与教师模型训练集同分布的数据样本;第二种方法中,对手无任何此类样本。实验表明,两种方法均可恢复出高度可辨识的数据记录。这意味着即便模型是不可访问的黑盒,仍可能被反演。
引用
@article{arxiv.2203.06570,
title = {Model Inversion Attack against Transfer Learning: Inverting a Model without Accessing It},
author = {Dayong Ye and Huiqiang Chen and Shuai Zhou and Tianqing Zhu and Wanlei Zhou and Shouling Ji},
journal= {arXiv preprint arXiv:2203.06570},
year = {2022}
}