缓解对话中的偏见:基于提示的仇恨言论分类器与去偏器
计算与语言
2023-07-21 v1 人工智能
摘要
歧视性语言和偏见常出现在对话中的仇恨言论里,通常对基于种族、性别和宗教等的目标群体产生负面影响。为解决此问题,我们提出一种包含两步过程的方法:首先使用分类器检测仇恨言论,然后利用去偏组件通过提示生成偏见较小或无偏见的替代内容。我们在基准数据集上评估了我们的方法,并观察到因仇恨言论评论导致的负面性有所降低。所提出的方法有助于持续减少在线话语中的偏见并促进更具包容性和公平性的交流环境。
引用
@article{arxiv.2307.10213,
title = {Mitigating Bias in Conversations: A Hate Speech Classifier and Debiaser with Prompts},
author = {Shaina Raza and Chen Ding and Deval Pandya},
journal= {arXiv preprint arXiv:2307.10213},
year = {2023}
}
备注
Accepted KDD - Data Science for Social Good