中文

BAARD:通过适用性、可靠性与可判定性测试阻断对抗样本

机器学习 2023-09-15 v2 生物大分子

摘要

对抗防御保护机器学习模型免受对抗攻击,但往往针对某一种模型或攻击量身定制。关于未知潜在攻击信息的缺乏使得检测对抗样本具有挑战性。此外,攻击者无需遵守防御者制定的规则。为解决此问题,我们从化学信息学中的适用性域概念获得启发。化学信息学模型难以做出准确预测,因为已知且可用于训练的化合物数量有限。适用性域基于已知化合物定义出一个域,并拒绝任何落在该域之外的未知化合物。类似地,对抗样本起初为无害输入,但可通过移出分类器域外而被操纵以逃避可靠分类。我们首次识别出适用性域与对抗检测之间的相似性。我们关注的不是未知攻击,而是已知的事物,即训练数据。我们提出了一种简单而鲁棒的三阶段数据驱动框架,该框架在全局与局部检查输入,并确认其与模型输出一致。该框架可应用于任何分类模型,且不限于特定攻击。我们展示了这三个阶段作为一个整体运作,有效检测各类攻击,即使在白盒场景下也是如此。

关键词

引用

@article{arxiv.2105.00495,
  title  = {BAARD: Blocking Adversarial Examples by Testing for Applicability, Reliability and Decidability},
  author = {Xinglong Chang and Katharina Dost and Kaiqi Zhao and Ambra Demontis and Fabio Roli and Gill Dobbie and Jörg Wicker},
  journal= {arXiv preprint arXiv:2105.00495},
  year   = {2023}
}