中文

基于深度学习架构的攻击性语言分析

计算与语言 2019-03-20 v3 机器学习

摘要

SemEval-2019 任务 6(Zampieri 等,2019b)要求我们识别并分类社交媒体中的攻击性语言。本文中,我们将描述应对这一挑战所采取的过程。我们的过程深受 Sosa(2017)启发,他提出了 CNN-LSTM 与 LSTM-CNN 模型来进行推特情感分析。我们决定沿用他的方法,并通过测试不同变体的 RNN 与 CNN 组合模型来推进其工作。具体而言,我们将该挑战分为两部分:数据处理与采样,以及选择最优深度学习架构。在预处理中,我们尝试了 SMOTE 与类权重两种技术以缓解类间不平衡。一旦对输入数据质量满意,我们便着手为该任务选择最优深度学习架构。鉴于所提供数据的质量与数量,我们发现添加 CNN 层对模型性能几乎无额外提升,有时甚至导致 F1 分数下降。最终,获得最高宏 F1 分数的深度学习架构是一个简单的 BiLSTM-CNN。

关键词

引用

@article{arxiv.1903.05280,
  title  = {Offensive Language Analysis using Deep Learning Architecture},
  author = {Ryan Ong},
  journal= {arXiv preprint arXiv:1903.05280},
  year   = {2019}
}

备注

6 pages, 8 tables, 1 figure