真相发现算法的公平性与偏差:一项实验分析
机器学习
2023-04-26 v1 计算机与社会
数据库
摘要
基于机器学习(ML)的方法正日益用于众多具有社会影响的应用中。训练 ML 模型通常需要大量标注数据,而众包是从多名工作者处获取标签的主要范式。众包工作者有时会提供不可靠的标签,为此,会应用如多数投票等真相发现(TD)算法,从相互冲突的 worker 响应中确定共识标签。然而需注意,这些共识标签仍可能基于性别、种族或政治倾向等敏感属性存在偏差。即便不涉及敏感属性,标签也可能因毒性等主观方面的不同视角而产生偏差。本文中,我们对 TD 算法的偏差与公平性进行了系统性研究。我们使用两个现有众包标注数据集的发现表明,有相当比例的 worker 提供有偏差的结果,且使用简单的 TD 方法并非最优。我们的研究还表明,流行的 TD 算法并非万灵药。此外,我们量化了这些不公平 worker 对下游 ML 任务的影响,并展示在此设定下,实现公平性与纠正标签偏差的常规方法无效。我们在文末呼吁设计能够改善这些问题的新型偏差感知真相发现算法。
引用
@article{arxiv.2304.12573,
title = {Fairness and Bias in Truth Discovery Algorithms: An Experimental Analysis},
author = {Simone Lazier and Saravanan Thirumuruganathan and Hadis Anahideh},
journal= {arXiv preprint arXiv:2304.12573},
year = {2023}
}
备注
Accepted in Algorithmic Fairness in Artificial intelligence, Machine learning and Decision Making workshop at SDM 2023