中文

利用多任务学习泛化仇恨言论检测:以政治公众人物为例

计算与语言 2025-04-07 v2 计算机与社会 社会与信息网络

摘要

自动识别仇恨和辱骂性内容对于遏制有害网络内容的传播及其破坏性影响至关重要。现有多数工作在评估模型时,通过考察模型在仇恨言论数据集训练-测试划分上的泛化误差来进行。这些数据集的定义和标注标准往往不同,导致在跨新领域和新数据集预测时泛化性能较差。本文提出一种新的多任务学习(MTL)流水线,同时在多个仇恨言论数据集上训练,以构建更具包容性的分类模型。利用数据集级留一法评估(指定一个数据集用于测试,并在所有其他数据集上联合训练),我们在新的、先前未见过的数据集上试验了MTL检测。我们的结果持续优于大量现有工作。我们展示了在训练-测试划分上考察泛化误差时的强劲结果,以及在预测先前未见过的数据集时的显著改进。此外,我们组装了一个名为PubFigs的新数据集,聚焦于美国政治公众人物的不当言论。我们使用Amazon MTurk众包标注了超过20,00020,000条推文,并对PubFigs中所有305,235305,235条推文中的不当言论进行机器标注。我们发现辱骂和仇恨推文主要来自右倾人物,并涉及六个话题,包括伊斯兰教、女性、种族和移民。我们表明MTL构建的嵌入能够同时分离辱骂言论与仇恨言论,并识别其话题。

关键词

引用

@article{arxiv.2208.10598,
  title  = {Generalizing Hate Speech Detection Using Multi-Task Learning: A Case Study of Political Public Figures},
  author = {Lanqin Yuan and Marian-Andrei Rizoiu},
  journal= {arXiv preprint arXiv:2208.10598},
  year   = {2025}
}