针对循环神经网络的模型提取攻击
密码学与安全
2020-02-04 v1 机器学习
摘要
模型提取攻击是一类攻击者通过高效查询目标模型(即使用比目标模型更少的数据集和计算资源)获得一个性能等价于目标模型的新模型的攻击。现有工作仅将简单的深度神经网络(DNNs,例如仅三层)作为模型提取攻击的目标,因此未意识到循环神经网络(RNNs)在处理时间序列数据方面的有效性。本文揭示了针对 RNNs 的模型提取攻击威胁。我们探讨能否利用简单的 RNN 从更复杂且更强大的 RNN——长短期记忆网络(LSTM)中提取出精度更高的模型。具体而言,我们解决以下问题。首先,在图像识别等分类问题中,通过利用序列中途的输出,提出从 LSTM 模型提取无最终输出的 RNN 模型。其次,在天气预报等回归问题中,提出一种通过重新配置损失函数的新攻击。我们使用公开学术数据集上训练的 RNN 和 LSTM 进行模型提取攻击实验,结果表明可以高效提取出精度更高的模型,尤其是通过配置损失函数以及与目标模型不同的更复杂架构。
引用
@article{arxiv.2002.00123,
title = {Model Extraction Attacks against Recurrent Neural Networks},
author = {Tatsuya Takemura and Naoto Yanai and Toru Fujiwara},
journal= {arXiv preprint arXiv:2002.00123},
year = {2020}
}