检测社交媒体毒性建模中的跨地理偏差
计算与语言
2021-10-01 v2
摘要
在线社交媒体平台日益依赖自然语言处理(NLP)技术大规模检测滥用内容,以减轻其对用户造成的危害。然而,这些技术受到训练数据中各种采样与关联偏差的影响,常导致在与边缘化群体相关的内容上表现不佳,可能进一步加剧对他们的不成比例伤害。迄今为止关于此类偏差的研究仅聚焦于少数具有标注/词典可用的差异轴和子群体,因此非西方语境下的偏差在文献中很大程度上被忽视。本文中,我们提出一种弱监督方法,以稳健地检测更广泛地理文化语境中的词汇偏差。通过对一个公开可用的毒性检测模型的案例研究,我们证明我们的方法能识别显著的跨地理错误分组,并在后续工作中表明这些分组反映了那些地理语境下人类对冒犯性与非冒犯性语言的判断。我们还对基于带真值标签数据集训练的模型进行分析以更好理解这些偏差,并给出了初步的缓解实验。
引用
@article{arxiv.2104.06999,
title = {Detecting Cross-Geographic Biases in Toxicity Modeling on Social Media},
author = {Sayan Ghosh and Dylan Baker and David Jurgens and Vinodkumar Prabhakaran},
journal= {arXiv preprint arXiv:2104.06999},
year = {2021}
}
备注
Proceedings of the 7th Workshop on Noisy User-generated Text (W-NUT)