eXIAA:针对对抗攻击的可解释注入
机器学习
2025-11-14 v1 人工智能
计算机视觉与模式识别
摘要
后置可解释性方法是机器学习 (ML) 中的一类方法,旨在提供模型行为背后的原因。本文提出一种新的针对后置可解释人工智能 (XAI) 的黑盒模型无关对抗攻击,尤其适用于图像领域。攻击目标是在不被人类眼睛察觉的情况下修改原始解释,同时保持相同的预测类别。与先前方法不同,我们无需访问模型或其权重,仅访问模型的计算预测和解释。此外,攻击仅需一步即可显著更改提供的解释,经实证评估证明。本方法的低要求暴露了当前可解释性方法的关键漏洞,引发对其在安全关键应用中可靠性的广泛关注。我们系统生成基于后置可解释性方法(显著性图、积分梯度和 DeepLIFT SHAP)生成的攻击,对预训练的 ResNet-18 和 ViT-B16 在 ImageNet 上的模型进行测试。结果表明,我们的攻击可在不改变预测概率的情况下导致解释发生 dramatic 变化。我们验证了攻击的有效性,基于解释计算诱导变化的平均绝对差,并通过结构相似性指数测度 (SSIM) 验证原始图像与被破坏图像的接近性。
引用
@article{arxiv.2511.10088,
title = {eXIAA: eXplainable Injections for Adversarial Attack},
author = {Leonardo Pesce and Jiawen Wei and Gianmarco Mengaldo},
journal= {arXiv preprint arXiv:2511.10088},
year = {2025}
}