通过解释突破视觉转换器安全幻象:受攻击下的可解释视觉转换器系统
密码学与安全
2025-07-22 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
视觉转换器(ViT)模型若搭配解释模型,便被视为安全且难以欺骗,因而适用于医疗、自动驾驶、无人机和机器人等安全关键领域。然而,对这些系统发起成功攻击可能导致严重后果。近期研究针对ViT模型的威胁主要聚焦于生成能高置信度欺骗模型的最小对抗扰动,却未考虑其对模型解释的影响。然而,解释模型的使用可有效辅助检测对抗样本。本研究探讨了即使结合解释模型,转换器模型仍面临对抗攻击的脆弱性。我们提出一种名为“AdViT”的攻击方法,生成能够同时误导给定转换器模型及其搭配解释模型的对抗样本。通过在多种转换器模型和两种基于转换器的解释器上进行大量实验,证明AdViT在白盒和黑盒场景中均实现100%攻击成功率。白盒场景下,达到最高98%的误分类置信度;黑盒场景下,达到最高76%的误分类置信度。值得注意的是,AdViT在两种场景中均生成准确的解释,使对抗样本更难以被检测。
引用
@article{arxiv.2507.14248,
title = {Breaking the Illusion of Security via Interpretation: Interpretable Vision Transformer Systems under Attack},
author = {Eldor Abdukhamidov and Mohammed Abuhamad and Simon S. Woo and Hyoungshick Kim and Tamer Abuhmed},
journal= {arXiv preprint arXiv:2507.14248},
year = {2025}
}