中文

谁畏惧对抗可迁移性?

机器学习 2022-10-07 v3 密码学与安全

摘要

对抗可迁移性,即对抗扰动能够同时欺骗多个学习模型的能力,长期以来都是对抗机器学习中的“大坏狼”。过去已多次展示出成功的基于可迁移性的攻击,其无需被攻击模型参数或训练数据的先验知识,这意味着机器学习模型对现实系统构成固有安全威胁。然而,该领域所有研究均将可迁移性视为概率性质,并试图估计在给定预定义评估集下可能误导目标模型的对抗样本比例。因此,这些研究忽略了一个事实:现实中的攻击者通常对攻击失败的成本高度敏感。我们认为,忽视这种敏感性导致了对可迁移性威胁的夸大认知,而实际上现实中的基于可迁移性的攻击极不可能成功。通过理论推理与一系列实证结果相结合,我们表明在黑盒设定下 practically 无法预测给定对抗样本是否可迁移至特定目标模型,从而质疑了对抗可迁移性作为对失败成本敏感的攻击者的现实攻击工具的有效性。

关键词

引用

@article{arxiv.2105.00433,
  title  = {Who's Afraid of Adversarial Transferability?},
  author = {Ziv Katzir and Yuval Elovici},
  journal= {arXiv preprint arXiv:2105.00433},
  year   = {2022}
}