解释性成为劣势:面向 CBM 概念层的对抗性攻击
机器学习
2026-05-26 v1 密码学与安全
计算机视觉与模式识别
摘要
概念瓶颈模型(CBM)已成为可解释机器学习的核心方法,通过显式的概念激活提供人类可理解的中间表示。然而,这种可解释性引入了一个尚未探讨的关键攻击面:概念瓶颈层本身。我们进行了对 CBM 概念层概念级对抗性脆弱性的全面、系统性研究,揭示了目标性、最小扰动的输入像素操作可通过操纵语义表示引发灾难性误分类。我们构建了严格的理论框架来量化概念空间的鲁棒性,建立了新指标暴露这些架构的脆弱性格局。我们的广泛分析表明,标准 CBM 在概念级操纵方面表现出严重的脆弱性。为解决此关键弱点,我们引入了 SPECTRA(基于语义扰动的概念训练稳定性正则化,以抵御攻击),一种原则化的稳定性正则化防御。SPECTRA 有效加固了语义表示空间,将成功攻击所需的最小扰动范数从 0.46 提升至超过 4,200,使针对性概念操纵变得计算上不可行。此外,SPECTRA 在保持基线分类准确率在 2.2% 以内的同时实现了防御。通过将概念级攻击确立为根本不同的威胁模型,本工作在可解释机器学习与对抗鲁棒性的交叉领域开辟了新的研究前沿。
引用
@article{arxiv.2605.25304,
title = {When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers},
author = {Aditya Sridhar},
journal= {arXiv preprint arXiv:2605.25304},
year = {2026}
}
备注
Accepted to CVPR 2026 (Findings). 9 pages, 6 figures