中文

校准攻击:针对模型置信度的对抗攻击综合研究

机器学习 2024-12-03 v3 密码学与安全

摘要

在这项工作中,我们强调并对校准攻击进行了全面研究,这是一种对抗攻击形式,旨在使受害模型严重失准而不改变其预测标签,从而危及模型的可信度以及基于其置信度的后续决策。我们提出了四种典型形式的校准攻击:欠置信、过置信、最大失准和随机置信攻击,并在黑盒和白盒设置下进行。我们证明这些攻击在卷积和基于注意力的模型上都非常有效:通过少量查询,它们严重扭曲置信度而不改变预测性能。鉴于潜在的危险,我们进一步研究了各种对抗防御和重校准方法的有效性,包括我们专门为校准攻击设计的防御措施以减轻危害。从ECE和KS分数来看,我们观察到在处理校准攻击方面仍然存在显著局限性。据我们所知,这是第一个专门针对校准攻击进行全面研究的系统性工作。我们希望这项研究有助于吸引更多关注这类攻击,从而阻止其潜在的严重损害。为此,本文还提供了详细的分析以理解攻击的特性。我们的代码可在 https://github.com/PhenetOs/CalibrationAttack 获取。

关键词

引用

@article{arxiv.2401.02718,
  title  = {Calibration Attacks: A Comprehensive Study of Adversarial Attacks on Model Confidence},
  author = {Stephen Obadinma and Xiaodan Zhu and Hongyu Guo},
  journal= {arXiv preprint arXiv:2401.02718},
  year   = {2024}
}

备注

Accepted at Transactions on Machine Learning Research