善摹者仿,大匠者窃:针对图像翻译模型的模型提取攻击
机器学习
2023-03-01 v2 密码学与安全
计算机视觉与模式识别
摘要
机器学习模型通常通过推理 API 提供给潜在客户用户。当恶意客户端利用从受害者模型 的推理 API 查询中获取的信息来构建具有相当功能的替代模型 时,就会发生模型提取攻击。近期研究表明,针对图像分类和自然语言处理模型的模型提取已成功实现。在本文中,我们展示了首个针对真实世界生成对抗网络(GAN)图像翻译模型的模型提取攻击。我们提出了一个执行此类攻击的框架,并表明 adversary 可以通过使用与 训练数据同域的数据查询 来成功提取功能性替代模型。除其预期任务外,adversary 无需知道 的架构或关于它的任何其他信息。我们使用两类流行图像翻译的三个不同实例评估了攻击的有效性:(1)Selfie-to-Anime 和(2)Monet-to-Photo(图像风格迁移),以及(3)Super-Resolution(超分辨率)。使用 GAN 的标准性能指标,我们表明我们的攻击是有效的。此外,我们在 Selfie-to-Anime 和 Monet-to-Photo 上进行了大规模(125 名参与者)用户研究,以表明人类对 和 生成图像的感知可被视为等价,在 Cohen's d = 0.3 的等价边界内。最后,我们表明现有的针对模型提取攻击的防御(水印、对抗样本、投毒)并不适用于图像翻译模型。
引用
@article{arxiv.2104.12623,
title = {Good Artists Copy, Great Artists Steal: Model Extraction Attacks Against Image Translation Models},
author = {Sebastian Szyller and Vasisht Duddu and Tommi Gröndahl and N. Asokan},
journal= {arXiv preprint arXiv:2104.12623},
year = {2023}
}
备注
19 pages