给 counterfactual 解释加上水印
机器学习
2024-10-22 v2 密码学与安全
统计方法学
摘要
反事实(CF)解释为受预测结果影响的个体提供可操作的补救建议。尽管CF解释被用户青睐,但已显示在实际应用中会造成显著的安全风险;特别是,恶意对手可以利用CF解释来对底层专有ML模型进行查询高效的模型提取攻击。为解决这一安全挑战,我们提出了CFMark,一种 novel model-agnostic watermarking 框架,用于检测依赖CF解释的未授权模型提取攻击。CFMark涉及一种 novel 双层优化问题,将不可察觉的水印嵌入到生成的CF解释中,以便任何使用这些水印CF解释的未来模型提取攻击都可以使用零假设显著性检验(NHST)方案进行检测。同时,嵌入的水印不会影响CF解释的质量。我们在多样化的真实数据集、CF解释方法和模型提取技术上评估了CFMark。我们的实证结果显示CFMark有效,在使用水印CF解释识别未授权模型提取攻击时,实现约0.89的F-1分数。重要的是,这种水印仅造成CF解释质量的轻微退化(即~1.3%的有效性退化和~1.6%的接近度退化)。我们的工作为CF解释在实际应用中的安全部署奠定了关键基础。
引用
@article{arxiv.2405.18671,
title = {Watermarking Counterfactual Explanations},
author = {Hangzhi Guo and Firdaus Ahmed Choudhury and Tinghua Chen and Amulya Yadav},
journal= {arXiv preprint arXiv:2405.18671},
year = {2024}
}