解释性、隐私与预测性能:基于解释辅助模型提取的交互作用
密码学与安全
2025-05-15 v1 人工智能
摘要
作为一种部署强大预测模型的便捷方式,机器学习即服务(MLaaS)已获得重要吸引力,使组织能够无需在专业基础设施或专业知识方面进行大额投资即可利用先进的分析工具。然而,MLaaS平台必须受到安全和隐私攻击的保护,如模型提取(MEA)攻击。随着可解释人工智能(XAI)在MLaaS中日益集成,隐私挑战也随之出现,攻击者可利用模型解释(尤其是反事实解释,CFs)来促进MEA。在本文中,我们研究在采用差分隐私(DP)这一缓解CF促进MEA的技术时,模型性能、隐私和可解释性之间的权衡。我们评估了两种不同的DP策略:一种在分类模型训练期间实现,另一种在生成CF的解释器上实现。
引用
@article{arxiv.2505.08847,
title = {On the interplay of Explainability, Privacy and Predictive Performance with Explanation-assisted Model Extraction},
author = {Fatima Ezzeddine and Rinad Akel and Ihab Sbeity and Silvia Giordano and Marc Langheinrich and Omran Ayoub},
journal= {arXiv preprint arXiv:2505.08847},
year = {2025}
}