高保真模型提取中的慢速信号问题
机器学习
2024-06-17 v1 人工智能
密码学与安全
摘要
深度神经网络因训练成本高昂且拥有丰富的知识产权价值,正日益受到威胁,这些威胁包括会 compromise 其保密性的模型提取攻击。以前的攻击成功地通过密码分析技术逆向工程出参数精度达到 float64 的模型,这些模型在最多三个隐藏层、随机数据上进行训练。然而,这一过程被确定非常耗时且不适用于在标准基准数据集上训练的更大更深的模型。我们的研究进一步评估了 Carlini 等人方法的可行性,这些方法已被 Canales-Martínez 等人 [2] 进一步增强,用于在标准基准数据集上训练的模型。我们引入了一个统一的代码库,将以前的方法集成其中,并揭示计算工具对性能的显著影响。我们进一步开发了针对提取权重符号的优化措施,通过识别更易提取和更难提取的神经元,提高了提取权重符号的效率,最高可提高 14.8 倍。与先前假设相反,我们确定提取权重(而非提取权重符号)是关键瓶颈。通过我们的改进,一个具有 16,721 个参数、两个隐藏层、在 MNIST 上训练的模型,可在仅 98 分钟内提取,而此前至少需要 150 分钟。最后,针对以前研究中观察到的方法论缺陷,我们提出了针对未来模型提取攻击的新型稳健基准测试方法。
引用
@article{arxiv.2406.10011,
title = {Beyond Slow Signs in High-fidelity Model Extraction},
author = {Hanna Foerster and Robert Mullins and Ilia Shumailov and Jamie Hayes},
journal= {arXiv preprint arXiv:2406.10011},
year = {2024}
}