中文

自动化定向公平性测试

机器学习 2018-08-02 v2 人工智能 软件工程 机器学习

摘要

公平性是决策中的关键特质。随着机器学习模型在敏感应用领域(如教育与就业)中日益用于决策,确保此类模型计算的决策无无意偏见至关重要。但我们如何自动验证任意机器学习模型的公平性?对于给定的机器学习模型和一组敏感输入参数,我们的 AEQUITAS 方法自动发现凸显公平性违背的歧视性输入。AEQUITAS 的核心是以揭示公平性违背为目标、在输入空间上采用概率搜索的三种新颖策略。我们的 AEQUITAS 方法利用常见机器学习模型中固有的鲁棒性属性来设计和实现可扩展的测试生成方法。我们所生成测试输入的一个吸引人特征是,它们可被系统地添加至底层模型的训练集并改善其公平性。为此,我们设计了一个全自动化模块,保证改善底层模型的公平性。我们实现了 AEQUITAS,并在六个最先进的分类器(包括一个以公平性约束设计的分类器)上进行了评估。我们表明 AEQUITAS 有效生成输入以揭示所有受试分类器中的公平性违背,并利用生成的测试输入系统性地改善相应模型的公平性。在我们的评估中,AEQUITAS 生成的歧视性输入高达 70%(相对于生成输入总数),并利用这些输入将公平性改善高达 94%。

关键词

引用

@article{arxiv.1807.00468,
  title  = {Automated Directed Fairness Testing},
  author = {Sakshi Udeshi and Pryanshu Arora and Sudipta Chattopadhyay},
  journal= {arXiv preprint arXiv:1807.00468},
  year   = {2018}
}

备注

In Proceedings of the 2018 33rd ACM/IEEE International Conference on Automated Software Engineering (ASE 18), September 3-7, 2018, Montpellier, France