超越标注预言机:窃取机器学习模型意味着什么?
机器学习
2024-06-14 v3 密码学与安全
摘要
模型提取攻击旨在仅通过查询访问来窃取训练好的模型,此类访问常由机器学习即服务(MLaaS)提供商以 API 形式提供。机器学习(ML)模型训练成本高昂,部分原因在于数据难以获取,而模型提取的主要动机是以低于从头训练的成本获得模型。模型提取相关文献常声称或假定攻击者可同时节省数据获取与标注成本。我们彻底评估该假设,发现攻击者往往并不能。这是因为当前攻击隐式依赖于敌手能从受害者模型的数据分布中采样。我们深入研究了影响模型提取成功与否的因素。我们发现攻击者的先验知识(即访问同分布数据)主导了其他因子,如敌手为选择查询受害者模型 API 所遵循的攻击策略。我们的发现敦促学界重新定义 ME 攻击的对抗目标,因为当前评估方法误读了 ME 性能。
引用
@article{arxiv.2310.01959,
title = {Beyond Labeling Oracles: What does it mean to steal ML models?},
author = {Avital Shafran and Ilia Shumailov and Murat A. Erdogdu and Nicolas Papernot},
journal= {arXiv preprint arXiv:2310.01959},
year = {2024}
}