对抗扰动下的公平分类
机器学习
2021-11-24 v2 人工智能
计算机与社会
数据结构与算法
机器学习
摘要
我们研究在无所不知的对手存在下的公平分类,该对手给定 后,可任意选择 比例的训练样本并任意扰动其受保护属性。其动机来自受保护属性可能因策略性误报、恶意行为者或归因错误而不正确的情况;而先前对误差作随机或独立性假设的方法在此对抗设定下可能无法满足其保证。我们的主要贡献是一个在此对抗设定下学习公平分类器的优化框架,附带关于精度与公平性的可证明保证。我们的框架适用于多个非二值受保护属性,为广泛的线性分式公平性度量而设计,且可处理除受保护属性外的扰动。我们证明了框架保证对于自然假设类的近紧性:无算法可取得显著更优精度,且任何取得更优公平性的算法必然精度更低。在实证中,我们针对一类对手在真实世界与合成数据集上评估了框架所生成分类器的统计率。
引用
@article{arxiv.2106.05964,
title = {Fair Classification with Adversarial Perturbations},
author = {L. Elisa Celis and Anay Mehrotra and Nisheeth K. Vishnoi},
journal= {arXiv preprint arXiv:2106.05964},
year = {2021}
}
备注
Full version of a paper accepted for presentation in NeurIPS 2021