DualCF:基于反事实解释的高效模型提取攻击
密码学与安全
2022-05-16 v1 人工智能
机器学习
摘要
云服务提供商已推出机器学习即服务(MLaaS)平台,允许用户通过 API 访问大规模云端模型。除预测输出外,这些 API 还能以更易于人理解的方式提供其他信息,例如反事实解释(CF)。然而,此类额外信息不可避免地使云模型更易遭受提取攻击,此类攻击旨在窃取云中模型的内部功能。但由于云模型的黑盒性质,现有攻击策略在替代模型达到高保真度前不可避免地需要海量查询。本文中,我们提出一种新颖、简单却高效的查询策略,以大幅提升窃取分类模型的查询效率。其动机源于我们的观察:当前查询策略因将远距离查询与接近边界的 CF 纳入替代模型训练而遭受决策边界偏移问题。我们随后提出 DualCF 策略以规避上述问题,其通过将 CF 及 CF 的反事实解释(CCF)共同作为替代模型的训练样本对来实现。我们在合成与真实世界数据集上进行了广泛而全面的实验评估。实验结果有力地表明,DualCF 能以更少查询高效且有效地生成高保真模型。
引用
@article{arxiv.2205.06504,
title = {DualCF: Efficient Model Extraction Attack from Counterfactual Explanations},
author = {Yongjie Wang and Hangwei Qian and Chunyan Miao},
journal= {arXiv preprint arXiv:2205.06504},
year = {2022}
}
备注
in Proceedings of the 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT '22), June 21-24, 2022, Seoul, Republic of Korea