攻击性语言检测:一项比较分析
计算与语言
2020-01-10 v1
摘要
攻击性行为已在互联网社区中变得普遍。个人利用网络世界中的匿名性,沉迷于在现实生活中可能不会考虑的攻击性交流。政府、在线社区、公司等正在投入资源以防止社交媒体中的攻击性内容。解决这一棘手问题的最有效方案之一是使用计算技术来识别攻击性内容并采取行动。当前工作聚焦于检测英语推文中的攻击性语言。实验所用数据集来自 SemEval-2019 Task 6(社交媒体中攻击性语言的识别与分类,OffensEval)。该数据集包含 14,460 条标注的英语推文。本文提供了一种比较分析以及基于随机厨房水槽(Random kitchen sink, RKS)的攻击性语言检测方法。我们探究了 Google sentence encoder、Fasttext、基于动态模态分解(Dynamic mode decomposition, DMD)的特征以及随机厨房水槽(RKS)方法在攻击性语言检测中的有效性。从实验与评估中我们观察到,RKS 结合 fasttext 取得了具有竞争力的结果。所使用的评估指标为准确率、精确率、召回率、F1 分数。
引用
@article{arxiv.2001.03131,
title = {Offensive Language Detection: A Comparative Analysis},
author = {Vyshnav M T and Sachin Kumar S and Soman K P},
journal= {arXiv preprint arXiv:2001.03131},
year = {2020}
}