APEACH:基于众包生成仇恨语音评估数据集分析的贬损表达攻击方法
计算与语言
2022-10-27 v3
摘要
在仇恨语音检测中,跨领域开发和训练与评估数据集是关键问题。然而,主流方法通常是爬取社交媒体文本并雇佣众包工作者对数据进行标注。遵循这一惯例往往将贬损表达的范围限制于单一领域,缺乏泛化能力。当在低资源语言上预训练语言模型时,训练语料与评估集之间的领域重叠会高估预测性能。为缓解韩语中的这些问题,我们提出 APEACH,该方法邀请未指定用户生成仇恨语音样本,随后进行最小限度的后标注。我们发现 APEACH 能够收集到对预训练语料与评估集之间词汇重叠较不敏感的有用数据集,从而恰当地衡量模型性能。
引用
@article{arxiv.2202.12459,
title = {APEACH: Attacking Pejorative Expressions with Analysis on Crowd-Generated Hate Speech Evaluation Datasets},
author = {Kichang Yang and Wonjun Jang and Won Ik Cho},
journal= {arXiv preprint arXiv:2202.12459},
year = {2022}
}
备注
Findings of EMNLP 2022