针对图像活动预测及其自然语言解释的黑盒攻击
计算机视觉与模式识别
2024-09-30 v1
摘要
可解释人工智能(XAI)方法旨在描述深度神经网络的决策过程。早期的 XAI 方法产生视觉解释,而更新的技术生成包含文本信息和视觉表示的多模态解释。视觉 XAI 方法已被证明易受白盒和灰盒对抗攻击,攻击者可完全或部分知晓并访问目标系统。由于多模态 XAI 模型的脆弱性尚未被检验,本文首次评估了自合理化基于图像的活动识别模型所生成自然语言解释对黑盒攻击的鲁棒性。我们生成无限制、空间变化的扰动,破坏预测与相应解释之间的关联,误导模型生成不忠实的解释。我们表明,仅通过访问活动识别模型的最终输出,即可创建操纵其解释的对抗图像。
引用
@article{arxiv.2310.00503,
title = {Black-box Attacks on Image Activity Prediction and its Natural Language Explanations},
author = {Alina Elena Baia and Valentina Poggioni and Andrea Cavallaro},
journal= {arXiv preprint arXiv:2310.00503},
year = {2024}
}
备注
Accepted at ICCV2023 AROW Workshop