针对语义分割模型的隐藏后门攻击
密码学与安全
2021-04-06 v3 人工智能
计算机视觉与模式识别
摘要
深度神经网络(DNNs)易受\emph{后门攻击}的威胁,该攻击旨在通过投毒训练数据在 DNNs 中嵌入隐藏后门。被攻击的模型在良性样本上表现正常,而当隐藏后门被激活时,其预测会被改变为特定的目标标签。迄今为止,后门研究大多针对分类任务展开。在本文中,我们揭示这一威胁也可能发生在语义分割中,这可能进一步危及许多关键任务应用(,自动驾驶)。除了将现有攻击范式扩展至从图像层面恶意操纵分割模型外,我们提出了一种新颖的攻击范式——\emph{细粒度攻击},其中我们将目标标签(,标注)从对象层面而非图像层面处理,以实现更精细的操纵。在由细粒度攻击生成的投毒样本标注中,仅特定对象的像素会被标注为攻击者指定的目标类别,而其他像素仍为其真实类别。实验表明,所提方法仅通过投毒很小比例的训练数据即可成功攻击语义分割模型。我们的方法不仅为设计新颖攻击提供了新视角,也作为增强语义分割方法鲁棒性的强基线。
引用
@article{arxiv.2103.04038,
title = {Hidden Backdoor Attack against Semantic Segmentation Models},
author = {Yiming Li and Yanjie Li and Yalei Lv and Yong Jiang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2103.04038},
year = {2021}
}
备注
This is a 6-pages short version of our ongoing work. It is accepted by the non-archival ICLR workshop on Security and Safety in Machine Learning Systems, 2021. The first two authors contributed equally to this work