人口统计特征不应成为毒性之源:通过实例加权缓解文本分类中的歧视
计算与语言
2020-08-21 v3 机器学习
机器学习
摘要
随着近期文本分类使用的激增,研究者发现文本分类数据集中存在某些非预期偏差。例如,在现有辱骂性语言检测数据集中,包含某些人口统计身份词(如“gay”、“black”)的文本更可能为辱骂性。因此,用这些数据集训练的模型可能仅因“gay”一词就将“She makes me happy to be gay”这样的句子视为辱骂性。在本文中,我们将文本分类数据集中的非预期偏差形式化为一种从非歧视分布到歧视分布的选择偏差。基于此形式化,我们进一步提出一种模型无关的去偏训练框架,通过实例加权恢复非歧视分布,除预定义的一组人口统计身份词外不需要任何额外资源或标注。实验表明,我们的方法能有效减轻非预期偏差的影响,且不显著损害模型的泛化能力。
引用
@article{arxiv.2004.14088,
title = {Demographics Should Not Be the Reason of Toxicity: Mitigating Discrimination in Text Classifications with Instance Weighting},
author = {Guanhua Zhang and Bing Bai and Junqi Zhang and Kun Bai and Conghui Zhu and Tiejun Zhao},
journal= {arXiv preprint arXiv:2004.14088},
year = {2020}
}
备注
Accepted by ACL 2020