机器学习模型中的不经意防御:无需检测的后门移除
机器学习
2024-11-06 v1 计算复杂性
密码学与安全
摘要
随着社会越来越依赖机器学习,确保机器学习系统免受复杂攻击的安全性成为一个紧迫的问题。Goldwasser, Kim, Vaikuntanathan 和 Zamir (2022) 最近的一项结果表明,对手可以在机器学习模型中植入不可检测的后门,从而允许对手隐蔽地控制模型的行为。后门可以以这种方式植入,使得带后门的机器学习模型在没有后门的诚实模型之间在计算上是不可区分的。在本文中,我们提出了防御机器学习模型中后门的策略,即使它们是不可检测的。关键观察是,有时可以在不需要检测的情况下,使用受随机自可归约性概念启发的技术,可证明地缓解甚至移除后门。这取决于真实标签(由自然选择)的属性,而不是提出的机器学习模型(可能由攻击者选择)的属性。我们给出了安全后门缓解的正式定义,并展示了两种类型的结果。首先,我们展示了一种“全局缓解”技术,该技术在真实标签接近傅里叶密集函数的假设下,移除机器学习模型中的所有后门。其次,我们考虑了真实标签接近 中的线性或多项式函数的分布。在这里,我们展示了“局部缓解”技术,该技术以高概率为每个感兴趣的输入移除后门,并且在计算上比全局缓解更便宜。我们所有的构造都是黑盒的,因此我们的技术无需访问模型的表示(即其代码或参数)即可工作。在此过程中,我们证明了一个关于稳健均值估计的简单结果。
引用
@article{arxiv.2411.03279,
title = {Oblivious Defense in ML Models: Backdoor Removal without Detection},
author = {Shafi Goldwasser and Jonathan Shafer and Neekon Vafa and Vinod Vaikuntanathan},
journal= {arXiv preprint arXiv:2411.03279},
year = {2024}
}