MER-探针:从攻击中性视角评估模型提取风险
密码学与安全
2025-09-24 v1
摘要
基于机器学习的 Web 应用中的信息泄露问题正受到越来越多的关注。虽然数据隐私泄露的风险已得到严格分析,但关于模型功能泄露(即模型提取攻击,Model Extraction Attacks, MEAs)的理论研究相对不足。本文首次从攻击中性视角理论性地理解 MEAs,并提出用于评估模型提取风险的分析指标。通过运用神经切向核(Neural Tangent Kernel, NTK)理论,我们将线性化的模型提取攻击形式化为正则化核分类问题,进而推导出攻击性能的保真度差距与泛化误差上界。基于这些理论分析,我们提出一种新型理论指标——模型恢复复杂度(Model Recovery Complexity, MRC),用于衡量受害模型与替代模型之间权重变化的距离,以量化风险。此外,我们发现受害模型准确率(victim model accuracy)与模型提取风险呈强正相关性,这一指标可作为经验性度量。整合上述两种指标,我们提出一种框架,即模型提取风险探针(Model Extraction Risk Inspector, MER-Inspector),以利用相对度量值比较不同模型架构下的提取风险。我们在 16 种模型架构和 5 个数据集上进行了大量实验。实验结果表明,所提出的指标与模型提取风险高度相关,MER-探针能够准确比较任意两个模型的提取风险,准确率达到 89.58%。
引用
@article{arxiv.2509.18578,
title = {MER-Inspector: Assessing model extraction risks from an attack-agnostic perspective},
author = {Xinwei Zhang and Haibo Hu and Qingqing Ye and Li Bai and Huadi Zheng},
journal= {arXiv preprint arXiv:2509.18578},
year = {2025}
}
备注
Published in ACM WWW 2025