多标签对抗扰动
机器学习
2019-01-04 v1 密码学与安全
机器学习
摘要
对抗样本是精心扰动的输入,旨在误导机器学习模型产生错误输出。虽然现有工作大多聚焦于在多类分类问题中生成对抗扰动,但许多现实应用属于多标签设定,即一个实例可能关联多个标签。例如,垃圾邮件发送者可能生成带有恶意广告的对抗垃圾邮件,同时保持主题标签等其他标签不变。为分析多标签学习模型的脆弱性与鲁棒性,我们研究多标签对抗扰动的生成。由于一个实例所关联正标签数量不确定,且多个标签通常彼此不互斥,这是一项具有挑战性的任务。为弥补这一差距,本文提出一个针对多标签分类问题的通用攻击框架,并对深度神经网络的扰动进行初步分析。利用标签间的排序关系,我们进一步设计了一个基于排序的框架来攻击多标签排序算法。我们阐明了两个所提框架之间的联系,并分别基于每个框架设计了两种具体方法以生成定向多标签扰动。在真实世界多标签图像分类与排序问题上的实验证明了我们所提框架的有效性,并揭示了多标签深度学习模型在不同定向攻击策略下的脆弱性。文末进一步提出并讨论了若干有趣发现,包括一种未完善的防御策略,其可能增强多标签深度学习模型的可解释性与鲁棒性。
引用
@article{arxiv.1901.00546,
title = {Multi-Label Adversarial Perturbations},
author = {Qingquan Song and Haifeng Jin and Xiao Huang and Xia Hu},
journal= {arXiv preprint arXiv:1901.00546},
year = {2019}
}