评估基于 RoBERTa 的仇恨言论检测模型中的简单去偏技术
计算与语言
2025-01-28 v1
摘要
仇恨言论检测任务已知会因 underlying 仇恨言论数据集中存在的注释偏差而受到对非裔美国英语(AAE)方言文本的偏见。这导致正常的 AAE 文本更容易被误分类为侮辱/仇恨文本,而非 AAE 文本则不然。过去发展了一些简单的去偏技术来抵消这种差异,但本文在 RoBERTa 基编码器的范围内应用并评估了这些技术。实验结果表明,这些技术的成功与训练数据集构建方法密切相关,但在充分考虑表示偏差的情况下,这些技术可以减少仇恨言论检测任务中不同语言方言子群之间的差异。
引用
@article{arxiv.2501.15430,
title = {Evaluating Simple Debiasing Techniques in RoBERTa-based Hate Speech Detection Models},
author = {Diana Iftimie and Erik Zinn},
journal= {arXiv preprint arXiv:2501.15430},
year = {2025}
}
备注
10 pages, 14 figures