刻画公平清洗的风险
机器学习
2021-11-04 v3 计算机与社会
摘要
公平清洗(fairwashing)指的是通过事后解释操纵,一个不公平的黑盒模型可被一个更公平的模型所解释的风险。本文中,我们通过分析其保真度-不公平性权衡来考察公平清洗攻击的能力。特别地,我们表明被公平清洗的解释模型可泛化到诉讼群体(即正被解释的数据点)之外,意味着一个被公平清洗的解释器可用于合理化黑盒模型后续的不公平决策。我们还证明公平清洗攻击可在黑盒模型间迁移,意味着其他黑盒模型可在不明确使用其预测的情况下实施公平清洗。这种公平清洗攻击的泛化性与可迁移性意味着其检测在实践中将十分困难。最后,我们提出一种量化公平清洗风险的方法,其基于计算高保真解释器的不公平性范围。
引用
@article{arxiv.2106.07504,
title = {Characterizing the risk of fairwashing},
author = {Ulrich Aïvodji and Hiromi Arai and Sébastien Gambs and Satoshi Hara},
journal= {arXiv preprint arXiv:2106.07504},
year = {2021}
}
备注
Accepted to NeurIPS 2021