中文

守卫之门:ConceptGuard 战胜概念瓶颈模型中的概念级后门

密码学与安全 2024-11-26 v1 计算机视觉与模式识别

摘要

人工智能模型,特别是深度学习模型的日益复杂,引发了关于透明度和问责制的担忧,尤其是在医疗诊断等高风险应用中,因而模型不透明会削弱信任。可解释人工智能 (XAI) 旨在通过提供清晰可解释的模型来解决这些问题。在 XAI 技术中,概念瓶颈模型 (CBM) 通过使用高层次语义概念来增强透明度。然而,CBM 容易受到概念级后门攻击的威胁,这类攻击将隐藏触发器注入这些概念,从而导致难以检测的异常行为。为解决这一关键安全问题,我们引入ConceptGuard,一个专为保护CBM免受概念级后门攻击而设计的新型防御框架。ConceptGuard采用多阶段方法,包括基于文本距离测量的概念聚类和来自不同概念子组中训练的分类器的投票机制,以隔离和缓解潜在触发器。我们的贡献有三方面:(i)我们将ConceptGuard作为面向CBM概念级后门攻击的首个防御机制; (ii)我们提供理论保证,表明ConceptGuard在一定触发器大小阈值内能有效防御此类攻击,确保其稳健性; (iii)我们展示ConceptGuard保持CBM的高性能和可解释性,这对于可信度至关重要。在通过全面实验和理论证明后,我们表明ConceptGuard显著增强了CBM的安全性和可信度,为其在关键应用中的安全部署铺平了道路。

关键词

引用

@article{arxiv.2411.16512,
  title  = {Guarding the Gate: ConceptGuard Battles Concept-Level Backdoors in Concept Bottleneck Models},
  author = {Songning Lai and Yu Huang and Jiayu Yang and Gaoxiang Huang and Wenshuo Chen and Yutao Yue},
  journal= {arXiv preprint arXiv:2411.16512},
  year   = {2024}
}

备注

17pages, 4 figures