中文

选择与组合互补特征表示及分类器用于仇恨言论检测

计算与语言 2022-01-19 v1 人工智能 社会与信息网络

摘要

由于每日产生的高体量数据,仇恨言论是社交网络中的一大问题。近期工作展示了机器学习(ML)在处理区分仇恨帖与仅讽刺或攻击性语言所需细微差别方面的有用性。许多用于仇恨言论检测的ML方案通过更改从文本提取特征的方式或所采用的分类算法而提出。然而,多数工作仅考虑一种特征提取与分类算法。本文主张需要多种特征提取技术与不同分类模型的组合。我们提出一个框架来分析多种特征提取与分类技术间的关系,以理解它们如何互补。该框架用于选取互补技术子集以构建鲁棒的仇恨言论检测多分类器系统(MCS)。考虑四个仇恨言论分类数据集的实验研究表明,所提框架是分析和设计该任务高性能MCS的有前景方法。利用所提框架获得的MCS系统显著优于所有模型组合及同质与异质选择启发式,证明了具备恰当选择方案的重要性。源代码、图表与数据集划分见于GitHub仓库:https://github.com/Menelau/Hate-Speech-MCS。

关键词

引用

@article{arxiv.2201.06721,
  title  = {Selecting and combining complementary feature representations and classifiers for hate speech detection},
  author = {Rafael M. O. Cruz and Woshington V. de Sousa and George D. C. Cavalcanti},
  journal= {arXiv preprint arXiv:2201.06721},
  year   = {2022}
}

备注

acceped for publication on the Online Social Networks and Media (OSNEM) journal