MISA:利用错误归因对木马模型进行在线防御
密码学与安全
2021-09-27 v2 计算机视觉与模式识别
机器学习
摘要
近期研究表明,神经网络易受木马攻击,即网络被训练为以特定且可能恶意的方式响应输入中特制的触发模式。本文提出 MISA,一种在推理时检测神经网络木马触发器的新型在线方法。我们的方法基于称为错误归因(misattributions)的新概念,其捕捉木马激活在特征空间中的异常表现。给定输入图像及相应输出预测,我们的算法首先计算模型对不同特征的归因,然后对这些归因进行统计分析以确定木马触发器的存在。在一组基准上,我们表明我们的方法能有效检测多种触发器模式的木马触发器,包括几种近期出现且尚无已知防御手段的模式。我们的方法在检测包含木马触发器的图像时达到了 96% 的 AUC,且不对触发模式作任何假设。
引用
@article{arxiv.2103.15918,
title = {MISA: Online Defense of Trojaned Models using Misattributions},
author = {Panagiota Kiourti and Wenchao Li and Anirban Roy and Karan Sikka and Susmit Jha},
journal= {arXiv preprint arXiv:2103.15918},
year = {2021}
}