中文

解除神经网络模型内部的隐写攻击

密码学与安全 2023-09-28 v2 多媒体

摘要

类似于开源代码共享的变革,人工智能(AI)模型共享正日益流行。然而,行业的快速适配、意识缺乏以及利用模型的能力使其成为了重要的攻击载体。通过在神经元中嵌入恶意软件,可隐蔽投送恶意软件,且对神经网络性能影响微小或无影响。该隐蔽攻击将利用最低有效位(LSB)权重攻击,因为 LSB 对模型精度影响极小,用户因而不会察觉。由于隐藏攻击的方式无穷无尽,我们聚焦于基于 AI 模型攻击解除与重建的零信任预防策略。我们提出了三类模型隐写权重解除防御机制。前两类基于随机比特替换噪声,另一类基于模型权重量化。我们展示了 100% 的预防率,同时基于 Qint8 和 K-LRBP 方法,这些方法引起的模型精度下降极小,这是提升 AI 安全性的重要因素。

关键词

引用

@article{arxiv.2309.03071,
  title  = {Disarming Steganography Attacks Inside Neural Network Models},
  author = {Ran Dubin},
  journal= {arXiv preprint arXiv:2309.03071},
  year   = {2023}
}