中文

“针对还是不针对”:使用分类器集成识别与分析滥用文本

计算与语言 2020-06-08 v1 社会与信息网络

摘要

随着对社交媒体平台上滥用和仇恨行为关注度的上升,我们提出了一种集成学习方法来识别并分析此类内容的语言特性。我们的堆叠集成由三个机器学习模型组成,这些模型捕捉语言的不同方面,并提供关于不当语言的多样且连贯的见解。所提出的方法在 Twitter 滥用行为数据集(Founta 等人,2018)上取得了与现有最优方法相当的结果,且未使用任何用户或网络相关信息,仅依赖于文本特性。我们相信所呈现的见解以及对当前方法缺陷的讨论将凸显未来研究的潜在方向。

关键词

引用

@article{arxiv.2006.03256,
  title  = {"To Target or Not to Target": Identification and Analysis of Abusive Text Using Ensemble of Classifiers},
  author = {Gaurav Verma and Niyati Chhaya and Vishwa Vinay},
  journal= {arXiv preprint arXiv:2006.03256},
  year   = {2020}
}

备注

In ICWSM'20 Safety Data Challenge