中文

利用解释信息实施模型反演攻击

计算机视觉与模式识别 2022-03-15 v3 计算机与社会 机器学习

摘要

人工智能(AI)在从医疗到招聘的诸多领域的成功部署要求其负责任地使用,尤其在模型解释与隐私方面。可解释人工智能(XAI)提供更多信息以帮助用户理解模型决策,但这额外的知识也暴露了隐私攻击的更多风险。因此,提供解释会损害隐私。我们研究了图像型模型反演攻击中的这一风险,并识别出若干性能递增的攻击架构,可从模型解释中重建私有图像数据。我们开发了多种多模态转置 CNN 架构,其反演性能显著高于仅使用目标模型预测的情况。这些 XAI 感知的反演模型旨在利用图像解释中的空间知识。为理解哪些解释具有更高隐私风险,我们分析了各类解释类型与因素如何影响反演性能。尽管部分模型不提供解释,我们进一步展示,通过注意力迁移利用替代模型的解释,即便对非可解释目标模型也能提升反演性能。该方法先由目标预测反演出解释,再重建目标图像。这些威胁凸显了解释所带来的紧迫且显著的隐私风险,并呼吁关注能够平衡 AI 可解释性与隐私双重需求的新隐私保护技术。

关键词

引用

@article{arxiv.2104.12669,
  title  = {Exploiting Explanations for Model Inversion Attacks},
  author = {Xuejun Zhao and Wencan Zhang and Xiaokui Xiao and Brian Y. Lim},
  journal= {arXiv preprint arXiv:2104.12669},
  year   = {2022}
}

备注

ICCV 2021