通过翻转有限权重比特针对深度神经网络的定向攻击
机器学习
2021-02-23 v1 密码学与安全
摘要
为探索深度神经网络(DNNs)的脆弱性,许多攻击范式已被充分研究,如训练阶段的基于投毒的后门攻击与推理阶段的对抗攻击。本文研究一种新颖的攻击范式,即在部署阶段为恶意目的修改模型参数。具体而言,我们的目标是在不修改任何样本的情况下将特定样本误分类为目标类,同时不显著降低其他样本的预测精度以确保隐蔽性。为此,由于参数以二进制比特(即 0 和 1)形式存储于内存中,我们将该问题表述为二值整数规划(BIP)。利用整数规划的最新技巧,我们将此 BIP 问题等价重构为连续优化问题,可使用交替方向乘子法(ADMM)有效且高效地求解。因此,被翻转的关键比特可通过优化轻松确定,而非使用启发式策略。大量实验证明了我们的方法在攻击 DNNs 上的优越性。
引用
@article{arxiv.2102.10496,
title = {Targeted Attack against Deep Neural Networks via Flipping Limited Weight Bits},
author = {Jiawang Bai and Baoyuan Wu and Yong Zhang and Yiming Li and Zhifeng Li and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2102.10496},
year = {2021}
}
备注
Accepted by ICLR 2021