面向可解释人工智能的隐私风险与保护方法:范围综述
人工智能
2025-12-04 v3 密码学与安全
摘要
可解释人工智能(Explainable Artificial Intelligence, XAI)已然成为可信赖人工智能(Trustworthy AI)的基石,旨在为本质上具有隐性特性的复杂模型带来透明度。尽管将解释纳入模型中具有诸多好处,但亟需关注向终端用户提供此类额外信息所带来的隐私问题。本文采用范围综述(scoping review)方法,对现有文献进行系统梳理,以厘清隐私与可解释性之间的冲突。我们从2019年1月至2044年12月从1943篇研究文献中抽取了57篇文章。本综述围绕三个研究问题展开,以增进读者对该议题的理解:(1)在AI系统中发布解释会产生哪些隐私风险?(2)当前研究者为实现XAI系统中的隐私保护采取了哪些方法?(3)何为一种符合隐私保护要求的解释?基于所选研究综合而得的知识,我们对XAI中的隐私风险与保护方法进行分类,并提出符合隐私要求的解释的特征,以帮助研究者和实践者理解XAI中隐私合规的需求。最后,我们识别了在平衡隐私与其他系统需求之间所面临的挑战,并提供实现隐私保护型XAI的建议。我们期望本综述能为可信赖AI的基本原则——隐私与可解释性之间复杂关系提供阐明。
引用
@article{arxiv.2505.02828,
title = {Privacy Risks and Preservation Methods in Explainable Artificial Intelligence: A Scoping Review},
author = {Sonal Allana and Mohan Kankanhalli and Rozita Dara},
journal= {arXiv preprint arXiv:2505.02828},
year = {2025}
}
备注
Published in Transactions on Machine Learning Research: https://openreview.net/forum?id=q9nykJfzku