中文

XSub:基于特征替换的针对黑盒分类器的解释驱动对抗攻击

机器学习 2024-09-16 v1 人工智能

摘要

尽管可解释人工智能(XAI)在增强人工智能(AI)系统的透明度和可信度方面具有显著优势,但其在实际应用中尚未充分发挥潜力。一个关键挑战是,XAI可能无意中为对手提供对黑盒模型的洞察,从而不可避免地增加它们对各种攻击的脆弱性。在本文中,我们开发了一种新颖的、基于特征替换的解释驱动对抗攻击,针对黑盒分类器,称为XSub。XSub的核心思想是策略性地将原始样本中的重要特征(通过XAI识别)替换为来自不同标签“黄金样本”的相应重要特征,从而增加模型对扰动样本误分类的可能性。特征替换的程度是可调的,这使我们能够控制原始样本信息被替换的比例。这种灵活性有效地平衡了攻击有效性与隐蔽性之间的权衡。XSub还具有极高的成本效益,因为实施攻击时对预测模型和解释模型所需的查询次数为O(1)。此外,如果攻击者能够访问模型的训练数据,XSub可以轻松扩展以发起后门攻击。我们的评估表明,XSub不仅有效且隐蔽,而且成本效益高,使其能够广泛应用于各类AI模型。

关键词

引用

@article{arxiv.2409.08919,
  title  = {XSub: Explanation-Driven Adversarial Attack against Blackbox Classifiers via Feature Substitution},
  author = {Kiana Vu and Phung Lai and Truc Nguyen},
  journal= {arXiv preprint arXiv:2409.08919},
  year   = {2024}
}