机器学习中针对后门攻击的模型无关防御
机器学习
2022-04-01 v3 密码学与安全
摘要
机器学习(ML)已使诸多日常决策领域(如教育、就业与驾驶自动化)实现自动化。ML 的持续成功在很大程度上取决于我们对自己所用模型的信任能力。近来,一类称为后门攻击的新攻击被提出。这些攻击破坏了用户对 ML 模型的信任。本工作中,我们提出 NEO,一种模型无关框架,用于检测并缓解图像分类 ML 模型中的此类后门攻击。对于给定的图像分类模型,我们的方法分析其接收的输入并判定该模型是否被植入后门。除该特性外,我们还通过确定中毒图像的正确预测来减轻这些攻击。NEO 一个引人注目的特性在于其首次能够隔离并重建后门触发器。据我们所知,NEO 也是首个完全黑盒的防御方法。我们已实现 NEO,并针对三个最先进的中毒模型进行评估。这些模型包含极关键的应用,如交通标志检测(USTS)与人脸检测。在我们的评估中,NEO 平均可检测约 88% 的中毒输入,且对每个输入图像快至 4.4 ms。我们还为用户重建中毒输入以有效测试其系统。
引用
@article{arxiv.1908.02203,
title = {Model Agnostic Defence against Backdoor Attacks in Machine Learning},
author = {Sakshi Udeshi and Shanshan Peng and Gerald Woo and Lionell Loh and Louth Rawshan and Sudipta Chattopadhyay},
journal= {arXiv preprint arXiv:1908.02203},
year = {2022}
}
备注
IEEE Transactions on Reliability, 2022