用基于公平性的集成框架缓解有毒语言检测中的种族偏见
计算与语言
2021-09-28 v1 机器学习
摘要
近期研究已表明,流行的有毒语言数据集中存在针对使用非裔美国人英语写作用户的种族偏见。先前工作聚焦于单一公平性准则,而我们提议使用额外的描述性公平度量来更好地理解这些偏见的来源。我们证明,不同的基准分类器以及两种过程中偏见消除技术,即使在更大的语料中也传播种族偏见。随后我们提出一种新颖的集成框架,其使用一个专门针对非裔美国人英语方言微调的专用分类器。我们展示了所提框架显著降低了模型从这些数据集中学到的种族偏见。我们证明了该集成框架在所有样本数据集上改善了公平性度量,且对分类性能影响极小,并提供了其能够遗忘针对使用非裔美国人英语作者的标注偏见的经验证据。**请注意本工作可能包含攻击性词语和短语示例。
引用
@article{arxiv.2109.13137,
title = {Mitigating Racial Biases in Toxic Language Detection with an Equity-Based Ensemble Framework},
author = {Matan Halevy and Camille Harris and Amy Bruckman and Diyi Yang and Ayanna Howard},
journal= {arXiv preprint arXiv:2109.13137},
year = {2021}
}
备注
Accepted to ACM EAAMO '21: https://eaamo.org/accepted/ Code available: https://github.com/matanhalevy/DebiasingHateDetectionAAE