中文

面向英语代码混合与单语文本的攻击性识别统一系统

计算与语言 2020-01-22 v2 信息检索

摘要

社交媒体平台的广泛使用增加了攻击性风险,导致精神压力并对人们生活产生负面影响,如心理痛苦、攻击行为和他人不尊重。此类对话大多包含代码混合语言[28]。此外,表达思想或交流风格的方式也因社交媒体平台而异(例如,Twitter 和 Facebook 的交流风格不同)。这些都增加了问题的复杂性。为解决这些问题,我们引入了一种统一且鲁棒的多模态深度学习架构,可同时适用于英语代码混合数据集和单语英语数据集。所设计的系统使用了心理语言学特征和非常基础的语言学特征。我们的多模态深度学习架构包含 Deep Pyramid CNN、Pooled BiLSTM 和 Disconnected RNN(均使用 Glove 和 FastText 嵌入)。最后,系统基于模型平均做出决策。我们在英语代码混合 TRAC 2018 数据集和从 Kaggle 获取的单语英语数据集上评估了我们的系统。实验结果表明,我们提出的系统在英语代码混合数据集和单语英语数据集上均优于以往所有方法。

关键词

引用

@article{arxiv.2001.05493,
  title  = {A Unified System for Aggression Identification in English Code-Mixed and Uni-Lingual Texts},
  author = {Anant Khandelwal and Niraj Kumar},
  journal= {arXiv preprint arXiv:2001.05493},
  year   = {2020}
}

备注

10 pages, 5 Figures, 6 Tables, accepted at CoDS-COMAD 2020