中文

微调即足以缓解后门攻击

密码学与安全 2022-12-20 v1 计算机视觉与模式识别 机器学习

摘要

后门攻击是机器学习模型面临的主要威胁之一。人们已经做出了各种努力来缓解后门。然而,现有的防御措施变得越来越复杂,通常需要大量的计算资源,或者也可能损害模型的效用。在这项工作中,我们表明,微调(最常见且易于采用的机器学习训练操作之一)可以有效地从机器学习模型中移除后门,同时保持高模型效用。在三种机器学习范式上的大量实验表明,微调和我们新提出的超级微调(super-fine-tuning)实现了强大的防御性能。此外,我们创造了一个新术语,即后门后遗症(backdoor sequela),用于衡量后门被移除前后模型对其他攻击的脆弱性变化。实证评估表明,与其他防御方法相比,超级微调留下的后门后遗症有限。我们希望我们的结果能帮助机器学习模型所有者更好地保护其模型免受后门威胁。同时,这也呼吁设计更先进的攻击方法,以全面评估机器学习模型的后门脆弱性。

关键词

引用

@article{arxiv.2212.09067,
  title  = {Fine-Tuning Is All You Need to Mitigate Backdoor Attacks},
  author = {Zeyang Sha and Xinlei He and Pascal Berrang and Mathias Humbert and Yang Zhang},
  journal= {arXiv preprint arXiv:2212.09067},
  year   = {2022}
}

备注

17 pages, 17 figures