CAT:面向概念瓶颈模型的概念级后门攻击
计算机视觉与模式识别
2025-08-19 v3 密码学与安全
摘要
尽管深度学习在多个领域取得了变革性的影响,但这些模型的内在不透明性推动了可解释人工智能(XAI)领域的发展。在这些努力中,概念瓶颈模型(CBM)作为一种通过利用高级语义信息来提高可解释性的关键方法。然而,CBM像其他机器学习模型一样容易受到安全威胁,尤其是后门攻击,这些攻击可隐式操控模型行为。鉴于社区尚未研究CBM的概念级后门攻击,因为“知其然则知其所以然,知其所以然则知其为鬼”,我们引入CAT(概念级后门攻击CBM),该方法利用CBM中的概念表示在训练期间嵌入触发器,从而在推理时实现对模型预测的受控操控。我们还提出了增强型攻击模式CAT+,它利用相关函数系统性地选择最有效且最隐蔽的概念触发器,从而优化攻击的影响。我们的全面评估框架评估了攻击成功率和隐蔽性,结果表明CAT和CAT+在干净数据上保持高性能,同时在后门数据集上实现显著的针对性效果。这一工作凸显了CBM潜在的安全风险,并为未来的安全评估提供了稳健的测试方法。
引用
@article{arxiv.2410.04823,
title = {CAT: Concept-level backdoor ATtacks for Concept Bottleneck Models},
author = {Songning Lai and Jiayu Yang and Yu Huang and Lijie Hu and Tianlang Xue and Zhangyi Hu and Jiaxu Li and Haicheng Liao and Yutao Yue},
journal= {arXiv preprint arXiv:2410.04823},
year = {2025}
}