中文

多语言社交网络文本表示方案用于过滤文本攻击性的实证评估

信息检索 2019-04-19 v1 计算与语言 社会与信息网络

摘要

本文试图研究文本表示方案在两个任务上的有效性,即:来自社交媒体内容的用户攻击性检测和事实检测。在用户攻击性检测中,目标是识别以英语、天城体印地语和罗马化印地语撰写的社交媒体生成内容中的攻击性水平。攻击性水平分为三个预定义类别:'非攻击性'、'公开攻击性'和'隐蔽攻击性'。在灾害相关事件期间,诸如Twitter之类的社交媒体被数百万帖子淹没。在此类紧急情况下,识别事实性帖子对于参与救援行动的组织至关重要。我们将此问题预期为分类与排序问题的结合。本文基于词袋(BoW)技术、分布式词/句表示、分类器上的迁移学习,对各种文本表示方案进行了比较。加权F1F_1分数被用作主要评估指标。结果表明,在机器学习分类器上,使用BoW的文本表示优于词嵌入。而预训练词嵌入技术在基于深度神经网络的分类器上表现更好。最近的迁移学习模型如ELMO、ULMFiT针对攻击性分类任务进行了微调。然而,结果不及预训练词嵌入模型。总体而言,使用fastText的词嵌入比Word2Vec和Glove产生更好的加权F1F_1分数。使用预训练向量模型进一步改善了结果。采用统计显著性检验以确保分类结果的重要性。对于不同于训练数据集的词汇不同测试数据集,深度神经模型更鲁棒且显著优于机器学习分类器。

关键词

引用

@article{arxiv.1904.08770,
  title  = {An Empirical Evaluation of Text Representation Schemes on Multilingual Social Web to Filter the Textual Aggression},
  author = {Sandip Modha and Prasenjit Majumder},
  journal= {arXiv preprint arXiv:1904.08770},
  year   = {2019}
}

备注

21 Page, 2 Figure