中文

AdvMind:推断黑盒攻击的对手意图

机器学习 2020-06-18 v1 密码学与安全 机器学习

摘要

深度神经网络(DNNs)即使在黑盒设置下也天然易受对抗攻击,其中对手仅能查询访问目标模型。在实践中,虽然可能有效检测此类攻击(例如,观察到大量相似但不相同的查询),但往往难以精确推断对手意图(例如,对手试图生成的对抗样本的目标类别),尤其是在攻击的早期阶段,而这在许多场景中对于执行有效的威胁威慑与补救至关重要。本文提出 AdvMind,一类以鲁棒且及时的方式推断黑盒对抗攻击对手意图的新估计模型。具体而言,为实现鲁棒检测,AdvMind 考虑了对手的适应性,使其隐藏目标的尝试将显著增加攻击成本(例如,就查询数量而言);为实现及时检测,AdvMind 主动合成合理的查询结果以诱使对手进行后续查询,从而最大程度暴露其意图。通过对基准数据集与最先进黑盒攻击的广泛实证评估,我们证明 AdvMind 平均在观测少于 3 个查询批次后以超过 75% 的准确率检测对手意图,同时将适应性攻击的成本提高超过 60%。我们进一步讨论了 AdvMind 与其他针对黑盒对抗攻击的防御方法之间可能的协同作用,指出了若干有前景的研究方向。

关键词

引用

@article{arxiv.2006.09539,
  title  = {AdvMind: Inferring Adversary Intent of Black-Box Attacks},
  author = {Ren Pang and Xinyang Zhang and Shouling Ji and Xiapu Luo and Ting Wang},
  journal= {arXiv preprint arXiv:2006.09539},
  year   = {2020}
}

备注

Accepted as a full paper at KDD 2020