改进反事实生成以实现公平的仇恨言论检测
计算与语言
2021-08-05 v1 计算机与社会
摘要
偏见缓解方法减少了模型对数据敏感特征(如社会群体标记SGTs)的依赖,从而在敏感特征上实现平等的预测。然而,在仇恨言论检测中,均衡模型预测可能会忽略目标社会群体之间的重要差异,因为仇恨言论可能包含针对每个SGT的刻板语言。本文为了考虑每个SGT的特定语言,依赖反事实公平性,并通过改变SGTs生成的反事实之间均衡预测。我们的方法评估反事实之间句子似然性的相似性(通过预训练语言模型),以便仅在可互换的上下文中平等对待SGTs。通过对每个实例的受限反事实集应用逻辑配对来均衡结果,我们在保持仇恨言论检测模型性能的同时,改善了公平性指标。
引用
@article{arxiv.2108.01721,
title = {Improving Counterfactual Generation for Fair Hate Speech Detection},
author = {Aida Mostafazadeh Davani and Ali Omrani and Brendan Kennedy and Mohammad Atari and Xiang Ren and Morteza Dehghani},
journal= {arXiv preprint arXiv:2108.01721},
year = {2021}
}
备注
4-page paper Workshop on Online Abuse and Harms (ACL 2021)