中文

善摹者仿,大匠者窃:针对图像翻译模型的模型提取攻击

机器学习 2023-03-01 v2 密码学与安全 计算机视觉与模式识别

摘要

机器学习模型通常通过推理 API 提供给潜在客户用户。当恶意客户端利用从受害者模型 FVF_V 的推理 API 查询中获取的信息来构建具有相当功能的替代模型 FAF_A 时,就会发生模型提取攻击。近期研究表明,针对图像分类和自然语言处理模型的模型提取已成功实现。在本文中,我们展示了首个针对真实世界生成对抗网络(GAN)图像翻译模型的模型提取攻击。我们提出了一个执行此类攻击的框架,并表明 adversary 可以通过使用与 FVF_V 训练数据同域的数据查询 FVF_V 来成功提取功能性替代模型。除其预期任务外,adversary 无需知道 FVF_V 的架构或关于它的任何其他信息。我们使用两类流行图像翻译的三个不同实例评估了攻击的有效性:(1)Selfie-to-Anime 和(2)Monet-to-Photo(图像风格迁移),以及(3)Super-Resolution(超分辨率)。使用 GAN 的标准性能指标,我们表明我们的攻击是有效的。此外,我们在 Selfie-to-Anime 和 Monet-to-Photo 上进行了大规模(125 名参与者)用户研究,以表明人类对 FVF_VFAF_A 生成图像的感知可被视为等价,在 Cohen's d = 0.3 的等价边界内。最后,我们表明现有的针对模型提取攻击的防御(水印、对抗样本、投毒)并不适用于图像翻译模型。

关键词

引用

@article{arxiv.2104.12623,
  title  = {Good Artists Copy, Great Artists Steal: Model Extraction Attacks Against Image Translation Models},
  author = {Sebastian Szyller and Vasisht Duddu and Tommi Gröndahl and N. Asokan},
  journal= {arXiv preprint arXiv:2104.12623},
  year   = {2023}
}

备注

19 pages