中文

深度学习系统中的模型复用攻击

密码学与安全 2018-12-04 v1

摘要

当今许多机器学习(ML)系统通过复用一组往往预训练的、实现不同功能(如特征提取)的基元模型来构建。基元模型使用的增多显著简化并加速了ML系统的开发周期。然而,由于此类模型大多由不可信来源提供和维护,其缺乏标准化或规范带来了深远的安全影响,而迄今为止对此知之甚少。本文中,我们展示恶意基元模型对ML系统的安全构成巨大威胁。我们提出一类广泛的‘模型复用’攻击,其中被恶意构造的模型会以高度可预测的方式触发宿主ML系统在目标输入上行为失常。通过对用于皮肤癌筛查、语音识别、人脸验证和自动驾驶转向的四个深度学习系统(含个体与集成系统)的实证研究,我们表明此类攻击具有:(i) 有效性——宿主系统以高概率在对手期望的目标输入上行为失常;(ii) 隐蔽性——恶意模型在非目标输入上的功能与其良性对应模型无法区分;(iii) 弹性——无论系统设计方案与调优策略如何变化,恶意模型均保持有效;(iv) 易行性——对手几乎不需要关于系统调优或推理所用数据的先验知识。我们给出了模型复用攻击有效性的分析依据,其指向当今基元模型前所未有的复杂性。因此该问题对许多ML系统而言似乎是根本性的。我们进一步讨论潜在的应对策略及其挑战,并引出若干有前景的研究方向。

关键词

引用

@article{arxiv.1812.00483,
  title  = {Model-Reuse Attacks on Deep Learning Systems},
  author = {Yujie Ji and Xinyang Zhang and Shouling Ji and Xiapu Luo and Ting Wang},
  journal= {arXiv preprint arXiv:1812.00483},
  year   = {2018}
}

备注

In Proceedings of the 2018 ACM Conference on Computer and Communications Security (CCS)