中文

应对图像识别中的后门攻击:缓解策略综述与评估

密码学与安全 2025-01-08 v2 机器学习

摘要

深度学习在各行各业的广泛应用带来了重大挑战,尤其是在模型可解释性和安全性方面。深度学习模型固有的复杂性,虽然有助于其有效性,但也使其容易受到对抗性攻击。其中,后门攻击尤其令人担忧,因为它们涉及在训练数据中秘密嵌入特定触发器,导致模型在接收到包含这些触发器的输入时表现出异常行为。此类攻击通常利用外包流程中的漏洞,在不影响对干净(无触发器)输入数据性能的情况下破坏模型完整性。在本文中,我们对旨在应对图像识别中后门攻击的现有缓解策略进行了全面回顾。我们深入分析了这些方法的理论基础、实际效果和局限性。此外,我们利用三个数据集、四种模型架构和三种投毒比率,对十六种最先进的方法针对八种不同的后门攻击进行了广泛的基准测试。我们的结果来自 122,236 次独立实验,表明虽然许多方法提供了一定程度的保护,但其性能可能差异很大。此外,与两种开创性方法相比,大多数较新的方法并未在不同设置下展现出整体性能或一致性的显著提升。基于这些发现,我们为未来开发更有效、更具泛化性的防御机制提出了潜在方向。

关键词

引用

@article{arxiv.2411.11200,
  title  = {Countering Backdoor Attacks in Image Recognition: A Survey and Evaluation of Mitigation Strategies},
  author = {Kealan Dunnett and Reza Arablouei and Dimity Miller and Volkan Dedeoglu and Raja Jurdak},
  journal= {arXiv preprint arXiv:2411.11200},
  year   = {2025}
}