通过不变理性化缓解有毒语言检测中的偏差
计算与语言
2021-06-15 v1
摘要
有毒语言的自动检测在保护社交媒体用户(尤其是少数群体)免受言语虐待方面发挥着重要作用。然而,在大多数用于毒性检测的训练数据集中,存在针对某些属性(包括性别、种族和方言)的偏差。这些偏差使得学习到的模型不公平,甚至可能加剧对人们的边缘化。考虑到当前用于通用自然语言理解任务的去偏方法无法有效缓解毒性检测器中的偏差,我们提议使用不变理性化(InvRat),这是一个由理性生成器和预测器组成的博弈论框架,以排除某些句法模式(例如身份提及、方言)与毒性标签之间的伪相关。我们通过实证表明,与先前的去偏方法相比,我们的方法在词汇和方言属性上均产生了更低的误报率。
引用
@article{arxiv.2106.07240,
title = {Mitigating Biases in Toxic Language Detection through Invariant Rationalization},
author = {Yung-Sung Chuang and Mingye Gao and Hongyin Luo and James Glass and Hung-yi Lee and Yun-Nung Chen and Shang-Wen Li},
journal= {arXiv preprint arXiv:2106.07240},
year = {2021}
}
备注
The 5th Workshop on Online Abuse and Harms at ACL 2021