利用其漏洞修复对抗性样本
密码学与安全
2026-01-05 v1 机器学习
神经与进化计算
摘要
深度神经网络分类器在处理对抗性样本(AEs)时容易出错。AEs 是对人类而言难以察觉的微小扰动输入,构成安全相关应用的重大风险。因此,广泛研究旨在开发防御机制以缓解其威胁。大多数现有方法主要侧重于基于输入样本特征对 AEs 进行判别,强调 AE 检测,而未解决攻击前的正确样本分类问题。虽然某些任务仅需对检测到的 AEs 进行简单拒绝,但其他任务(如自动驾驶中的交通标志识别)则需要识别其原始输入类别的正确分类。本研究旨在提出一种方法,对 AEs 进行修复以估计其原始输入的正确标签。该方法基于重新攻击 AEs 将其置于决策边界之外,以实现准确的标签预测,从而有效解决由白盒攻击方法创建的难以察觉的 AEs 的修复问题。然而,针对黑盒攻击在边界外距离较远的 AEs,或由目标攻击将其误分类至低置信度类别的 AEs,仍面临有效修复的挑战。通过仅将 AEs 作为输入采用简单方法,所提出的方法可针对各种攻击方式工作,无需参数调整或预先训练。结果表明,所提出的方法在各种攻击方法生成的 AEs 上表现一致,包括目标攻击和黑盒攻击。此外,它在稳定性方面优于传统修复和输入转换方法。
引用
@article{arxiv.2601.00270,
title = {Rectifying Adversarial Examples Using Their Vulnerabilities},
author = {Fumiya Morimoto and Ryuto Morita and Satoshi Ono},
journal= {arXiv preprint arXiv:2601.00270},
year = {2026}
}