XRand:针对解释引导攻击的差分隐私防御
机器学习
2022-12-15 v3 密码学与安全
摘要
可解释人工智能(XAI)领域的近期发展有助于提升机器学习即服务(MLaaS)系统的可信度,在该系统中,针对每个查询会随模型预测一并提供解释。然而,XAI 也为攻击者洞悉 MLaaS 中的黑盒模型打开了大门,从而使模型更易遭受若干攻击。例如,基于特征的解释(如 SHAP)可能暴露黑盒模型所关注的最重要特征。此类披露已被利用来针对恶意软件分类器精心构造有效的后门触发器。为应对这一权衡,我们引入了在解释中实现局部差分隐私(LDP)的新概念,并由此建立了一种称为 XRand 的防御机制以抵御此类攻击。我们表明,该机制限制了攻击者所能了解的关于最重要特征的信息,同时保持了解的忠实性。
引用
@article{arxiv.2212.04454,
title = {XRand: Differentially Private Defense against Explanation-Guided Attacks},
author = {Truc Nguyen and Phung Lai and NhatHai Phan and My T. Thai},
journal= {arXiv preprint arXiv:2212.04454},
year = {2022}
}
备注
To be published at AAAI 2023