中文

对抗样本能否被解析以揭示受害模型信息?

计算机视觉与模式识别 2024-07-16 v3

摘要

众多对抗攻击方法已被开发出来,用以生成难以察觉的图像扰动,从而导致最先进机器学习(ML)模型(尤其是深度神经网络(DNN))的错误预测。尽管对抗攻击研究激烈,但鲜有努力去揭示对抗攻击中所携带的“奥秘”。本工作中,我们探讨是否可能从数据相关的对抗实例中推断出与数据无关的受害模型(VM)信息(即用于生成对抗攻击的ML模型或DNN的特征)。我们称之为“对抗攻击的模型解析”——一项揭示攻击中隐藏的VM信息的“奥秘”的任务。我们通过监督学习来进行模型解析,将VM模型属性(就架构类型、核大小、激活函数和权重稀疏度而言)的类别正确地分配给从该VM生成的攻击实例。我们收集了一个跨越7种攻击类型的对抗攻击数据集,这些攻击由135个受害模型生成(由5种架构类型、3种核大小设置、3种激活函数类型和3种权重稀疏度比例配置)。我们展示了一个简单的监督模型解析网络(MPN)能够从未见过的对抗攻击中推断VM属性,只要其攻击设置与训练设置一致(即分布内泛化评估)。我们还提供了大量实验来证明从对抗攻击进行VM解析的可行性,以及训练和评估因素对解析性能的影响(例如分布外评估所提出的泛化挑战)。我们进一步展示了所提出的MPN如何用于从迁移攻击中揭示源VM属性,并阐明了模型解析与攻击可迁移性之间的潜在联系。

关键词

引用

@article{arxiv.2303.07474,
  title  = {Can Adversarial Examples Be Parsed to Reveal Victim Model Information?},
  author = {Yuguang Yao and Jiancheng Liu and Yifan Gong and Xiaoming Liu and Yanzhi Wang and Xue Lin and Sijia Liu},
  journal= {arXiv preprint arXiv:2303.07474},
  year   = {2024}
}