Fairwashing:合理化的风险
机器学习
2019-05-16 v3 机器学习
摘要
黑盒解释是指解释一个机器学习模型——其内部逻辑对审计者隐藏且通常复杂——如何产生其输出的问题。当前解决该问题的方法包括模型解释、结果解释以及模型检测。虽然这些技术可通过提供可解释性而有益,但它们也可能被负面地用于实施fairwashing(我们将其定义为助长机器学习模型尊重某些伦理价值的错误认知)。特别地,我们证明可以利用模型解释以及给定公平性度量的结果解释方法,系统性地合理化由不公平黑盒模型做出的决策。我们的解决方案LaundryML基于一种正则化规则列表枚举算法,其目标是搜索近似不公平黑盒模型的公平规则列表。我们在真实世界数据集上训练的黑盒模型上对所提合理化技术进行实证评估,结果表明可获得对黑盒模型高保真度的规则列表,同时显著更不公平程度更低。
引用
@article{arxiv.1901.09749,
title = {Fairwashing: the risk of rationalization},
author = {Ulrich Aïvodji and Hiromi Arai and Olivier Fortineau and Sébastien Gambs and Satoshi Hara and Alain Tapp},
journal= {arXiv preprint arXiv:1901.09749},
year = {2019}
}
备注
Accepted to ICML 2019