中文

对抗样本的转移性排序

机器学习 2024-04-19 v2 密码学与安全

摘要

黑盒场景下的对抗转移性带来一个独特挑战:攻击者虽可利用替代模型生成对抗样本,却无法确保这些样本能成功攻破目标模型。迄今为止,确认成功与否的普遍方法是试错——直接在受害模型上测试所构造的样本。然而,这种方法每次尝试都有被检测到的风险,迫使攻击者要么一击即中,要么面临暴露。本文提出一种排序策略,优化转移攻击流程,使攻击者无需在受害系统上反复尝试即可估计成功概率。通过利用一组多样化的替代模型,我们的方法能够预测对抗样本的转移性。该策略既可用于筛选攻击中使用的最佳样本,也可用于确定施加于特定样本的最佳扰动。借助我们的策略,对抗样本的转移性从仅 20%(类似于随机选取)提升至接近上限水平,部分场景甚至达到 100% 成功率。这一显著提升不仅揭示了不同架构间共有的脆弱性,也表明攻击者可以摒弃易被检测的试错策略,从而增加了基于替代模型攻击的威胁。

关键词

引用

@article{arxiv.2208.10878,
  title  = {Transferability Ranking of Adversarial Examples},
  author = {Mosh Levy and Guy Amit and Yuval Elovici and Yisroel Mirsky},
  journal= {arXiv preprint arXiv:2208.10878},
  year   = {2024}
}