Hack The Box:欺骗基于深度学习的抽象监控器
机器学习
2021-07-20 v3 人工智能
密码学与安全
摘要
深度学习是一种适配概念深层层次的机器学习类型。深度学习分类器将输入层处概念的最基本版本连接到输出层处概念的最抽象版本,亦称类或标签。然而,一旦在有限类集上训练完毕,某些深度学习模型无力表明给定输入不属于任一类别,因而根本无法被关联。正确否定不相关类的预测是一个具挑战性的问题,文献中已以多种方法应对。新颖性检测赋予深度学习对新颖/未见类输出“不知道”的能力。然而,新颖性检测的安全方面尚未受到关注。本文中,我们考虑基于抽象的新颖性检测案例研究,表明其对抗样本并不鲁棒。此外,我们展示了精心构造同时欺骗深度学习分类器并绕过新颖性检测监控的对抗样本之可行性。换言之,这些监控盒子是可被攻破的。我们论证新颖性检测本身最终成为攻击面。
引用
@article{arxiv.2107.04764,
title = {Hack The Box: Fooling Deep Learning Abstraction-Based Monitors},
author = {Sara Hajj Ibrahim and Mohamed Nassar},
journal= {arXiv preprint arXiv:2107.04764},
year = {2021}
}