基于机器学习的代码审查者推荐公平性的初步考察
软件工程
2023-07-24 v1
摘要
机器学习(ML)方法的公平性对现代人工智能系统的可靠性至关重要。尽管该主题已有广泛研究,软件工程(SE)领域中ML模型的公平性仍未被充分探索。因此,许多由ML驱动的软件系统,尤其是软件工程界所用的系统,持续面临公平性问题。本文以典型SE任务之一即代码审查者推荐为对象,首次研究SE领域中ML应用的公平性问题。我们的实证研究表明,当前最先进的基于ML的代码审查者推荐技术表现出不公平与歧视行为。具体而言,男性审查者相较其在审查者集中的分布平均多获得7.25%的推荐,而女性代码审查者则更少。本文还讨论了所研究基于ML的代码审查者推荐系统不公平的原因,并提供了缓解不公平性的方案。我们的研究进一步表明,现有缓解方法在受保护群体与特权群体分布相似的项目中可将公平性提升100%,但其在不平衡或偏斜数据上改善公平性的效果有限。最终,我们提出一种方案以克服现有缓解技术的缺陷,并处理不平衡或偏斜数据集中的偏差。
引用
@article{arxiv.2307.11298,
title = {A First Look at Fairness of Machine Learning Based Code Reviewer Recommendation},
author = {Mohammad Mahdi Mohajer and Alvine Boaye Belle and Nima Shiri harzevili and Junjie Wang and Hadi Hemmati and Song Wang and Zhen Ming and Jiang},
journal= {arXiv preprint arXiv:2307.11298},
year = {2023}
}