Dikaios:通过属性推断攻击对算法公平性的隐私审计
密码学与安全
2022-11-28 v2 机器学习
摘要
机器学习(ML)模型已部署于高风险应用。由于数据集中观测到的敏感属性存在类不平衡,ML 模型在由敏感属性(如种族与性别)界定的少数子群上是不公平的。处理中公平性算法确保模型预测独立于敏感属性。此外,ML 模型易受属性推断攻击,其中 adversary 可通过利用其可区分的模型预测识别敏感属性的值。尽管隐私与公平是可信 ML 的重要支柱,公平性算法在属性泄露方面引入的隐私风险尚未被研究。我们将属性推断攻击确定为审计黑盒公平性算法的有效措施,以使模型构建者能在模型设计中考量隐私与公平。我们提出 Dikaios,一个面向模型构建者的公平性算法隐私审计工具,其利用一种新颖有效的属性推断攻击,通过自适应预测阈值考量敏感属性中的类不平衡。我们评估了 Dikaios 对五种数据集上两种处理中公平性算法的隐私审计。我们表明,带自适应预测阈值的属性推断攻击显著优于先前的攻击。我们强调了处理中公平性算法在确保跨不同敏感属性值预测不可区分方面的局限性。事实上,这些处理中公平性方案的属性隐私风险随数据集中敏感属性的比例高度可变。公平性机制对属性隐私风险这种不可预测的影响是其应用的重要局限,模型构建者必须加以考量。
引用
@article{arxiv.2202.02242,
title = {Dikaios: Privacy Auditing of Algorithmic Fairness via Attribute Inference Attacks},
author = {Jan Aalmoes and Vasisht Duddu and Antoine Boutet},
journal= {arXiv preprint arXiv:2202.02242},
year = {2022}
}
备注
The paper's results and conclusions underwent significant changes. The updated paper can be found at arXiv:2211.10209