利用网络性质检测错误输入
计算机视觉与模式识别
2023-03-28 v3 机器学习
摘要
神经网络易受多种错误输入的攻击,例如对抗样本、 corrupted 样本、分布外样本和误分类样本。在这项工作中,我们训练了一个线性 SVM 分类器,利用预训练神经网络的隐藏层和 softmax 特征向量来检测这四类错误数据。我们的结果表明,这些故障数据类型通常与正确样本在激活特性上呈线性可分,使我们能够在无需额外训练或开销的情况下拒绝不良输入。我们在多种数据集、领域、预训练模型和对抗攻击上通过实验验证了我们的发现。
引用
@article{arxiv.2002.12520,
title = {Utilizing Network Properties to Detect Erroneous Inputs},
author = {Matt Gorbett and Nathaniel Blanchard},
journal= {arXiv preprint arXiv:2002.12520},
year = {2023}
}