面向可解释人工智能的隐私增强技术整合
人工智能
2025-12-30 v1
摘要
可解释人工智能 (XAI) 是缓解黑箱人工智能系统决策过程非透明风险的关键路径。然而,尽管存在这些好处,XAI 方法被发现会泄露用于训练或查询模型的个人数据的隐私。研究人员已演示了利用解释进行推断个体敏感个人信息的隐私攻击。目前缺乏针对已知针对生产环境和机器学习即服务系统中脆弱 XAI 的隐私攻击的防御措施。为弥补这一差距,本文探索将隐私增强技术 (PETs) 作为针对基于特征的 XAI 方法提供的解释属性推断的防御机制。我们对三类 PETs,即合成训练数据、差分隐私训练和噪声添加,在两类基于特征的 XAI 方法上进行经验评估。我们的评估确定不同响应来自缓解方法以及 PETs 对其他系统属性如实用性和性能的副作用。在最佳情况下,PETs 在解释中集成可降低攻击风险 49.47%,同时保持模型实用性和解释质量。通过我们的评估,我们确定在 XAI 中使用 PETs 以最大化收益并最小化此隐私攻击对敏感个人信息成功性的策略。
引用
@article{arxiv.2507.04528,
title = {Towards integration of Privacy Enhancing Technologies in Explainable Artificial Intelligence},
author = {Sonal Allana and Rozita Dara and Xiaodong Lin and Pulei Xiong},
journal= {arXiv preprint arXiv:2507.04528},
year = {2025}
}
备注
Under peer review