用于检测 AI 模型个体歧视的自动化测试生成
人工智能
2018-09-11 v1
摘要
AI 模型的可靠性对于确保 AI 系统被完全接受至关重要。可靠 AI 系统的关键方面之一是确保其所有决策都是公平的,且不对任何个体存在偏见。在本文中,我们解决检测模型是否存在个体歧视的问题。当两个个体仅在其受保护属性(如性别/种族)的取值上不同,而其非受保护属性的取值完全相同时,却得到不同的决策,这种歧视便存在。衡量个体歧视需要穷举测试,这对于非平凡系统是不可行的。在本文中,我们提出了一种生成测试输入的自动化技术,旨在发现个体歧视。我们的技术将称为符号执行(symbolic execution)的知名技术与用于生成有效测试用例的局部可解释性相结合。我们的实验结果清楚地表明,在所有选定的基准测试中,我们的技术比现有最先进(state-of-the-art)方法多产生 3.72 倍的成功测试用例。
引用
@article{arxiv.1809.03260,
title = {Automated Test Generation to Detect Individual Discrimination in AI Models},
author = {Aniya Agarwal and Pranay Lohia and Seema Nagar and Kuntal Dey and Diptikalyan Saha},
journal= {arXiv preprint arXiv:1809.03260},
year = {2018}
}