盗贼军团:基于集成的样本选择增强黑盒模型提取
机器学习
2023-11-09 v1 人工智能
密码学与安全
计算机视觉与模式识别
摘要
机器学习(ML)模型在作为服务部署时,易遭受模型窃取攻击(MSA)。在此类攻击中,攻击者反复查询已部署模型以构建带标签数据集。该数据集使攻击者能够训练一个模仿原模型的盗取模型(thief model)。为最大化查询效率,攻击者须从可用数据池中选取信息量最大的数据点子集。现有攻击策略利用主动学习与半监督学习等方法以最小化成本。然而,在黑盒设定下,这些方法可能选取次优样本,因为它们仅训练一个盗取模型。取决于盗取模型的容量及其预训练所用数据,该模型甚至可能选取损害学习过程的含噪样本。本工作中,我们探索使用深度学习模型集成作为盗取模型。我们称我们的攻击为盗贼军团(Army of Thieves, AOT),因为我们将多个不同复杂度的模型进行训练以利用群体智慧。基于集成的集体决策,不确定样本被选取用于查询,而最置信样本则直接纳入训练数据。我们的方法是首个利用盗取模型集成来执行模型提取的方法。在 CIFAR-10 数据集上训练的模型,我们相较现有最先进方法的基准途径至少高出 3%,且对抗样本可迁移性比先前工作高 21%。
引用
@article{arxiv.2311.04588,
title = {Army of Thieves: Enhancing Black-Box Model Extraction via Ensemble based sample selection},
author = {Akshit Jindal and Vikram Goyal and Saket Anand and Chetan Arora},
journal= {arXiv preprint arXiv:2311.04588},
year = {2023}
}
备注
10 pages, 5 figures, paper accepted to WACV 2024