自动毒性评论检测中的偏差调查:一项实证研究
计算与语言
2021-08-17 v1 人工智能
机器学习
音频与语音处理
摘要
随着在线平台的激增,用户通过这些平台的评论和反应参与互动的数量也大幅上升。此类文本评论中有很大一部分对受众具有辱骂性、粗鲁性和冒犯性。由于机器学习系统就位以检查此类评论进入平台,训练数据中存在的偏差会传递至分类器,导致对特定类别、宗教和性别的歧视。本文中,我们评估不同分类器与特征,以估计这些分类器中的偏差及其在毒性分类下游任务上的性能。结果表明,自动毒性评论检测模型性能的提升与缓解这些模型中的偏差呈正相关。在我们的工作中,带注意力机制的LSTM被证明优于CNN模型。进一步分析显示,在训练毒性评论检测模型时,fasttext嵌入略优于glove嵌入。更深入分析揭示了即便模型具有高AUC分数,此类自动模型仍对特定身份群体存在明显偏差。最后,为缓解毒性检测模型中的偏差,以毒性子类型作为辅助任务的多任务设置被证明有效,使AUC分数提升多达0.26%(相对6%)。
引用
@article{arxiv.2108.06487,
title = {Investigating Bias In Automatic Toxic Comment Detection: An Empirical Study},
author = {Ayush Kumar and Pratik Kumar},
journal= {arXiv preprint arXiv:2108.06487},
year = {2021}
}