用于突破深度学习后门攻击防御的特洛伊木马训练
密码学与安全
2022-03-30 v1 人工智能
机器学习
摘要
使用深度神经网络的机器学习(ML)模型易受后门攻击。此类攻击涉及由对手插入(隐藏)触发器。结果,任何包含该触发器的输入都会导致神经网络将输入误分类至(单一)目标类,同时正确分类其他不含触发器的输入。含有后门的 ML 模型称为特洛伊模型。当仅能获取模型输出时,后门在安全关键网络与网络物理系统中后果严重。防御机制已被开发并证明能够在单目标后门攻击下以 >96% 的准确率区分特洛伊模型与非特洛伊模型的输出。理解防御机制的局限性需要构造该机制失效的样例。当前单目标后门攻击每个目标类需要一个触发器。我们提出一种更通用的新攻击,使单一触发器能导致误分类至多个目标类。此类误分类取决于输入所属的真实(实际)类。我们称此类攻击为多目标后门攻击。我们证明,带有单目标或多目标触发器的特洛伊模型可被训练,从而使旨在区分特洛伊与非特洛伊模型输出的防御机制准确率下降。我们的方法将非特洛伊模型作为特洛伊模型的教师,并求解特洛伊模型与防御机制之间的最小-最大优化问题。实证评估表明,我们的训练过程将一种最先进防御机制的准确率从 >96% 降至 0%。
引用
@article{arxiv.2203.15506,
title = {Trojan Horse Training for Breaking Defenses against Backdoor Attacks in Deep Learning},
author = {Arezoo Rajabi and Bhaskar Ramasubramanian and Radha Poovendran},
journal= {arXiv preprint arXiv:2203.15506},
year = {2022}
}
备注
Submitted to conference