中文

厌女推文检测:基于小数据集的CNN建模

计算与语言 2020-08-31 v1 机器学习 社会与信息网络

摘要

近年来,社交媒体平台Twitter上针对女性的网络虐待引起了广泛关注。一种有效识别厌女虐待的自动化方法,可增进我们对持续时间段内虐待推文的相关模式、驱动因素及应对有效性的理解。然而,利用少量标注数据训练神经网络(NN)模型以检测厌女推文十分困难。这部分归因于含有厌女内容的推文性质复杂,以及NN模型中需学习的参数数量庞大。我们进行了一系列实验,探究如何有效训练NN模型检测厌女推文。特别地,我们定制并正则化了一种卷积神经网络(CNN)架构,并表明在特定任务领域上预训练的词向量可用于在仅有少量标注数据时有效训练CNN模型。以此方式训练的CNN模型相较于最先进(SOTA)模型取得了更高的准确率。

关键词

引用

@article{arxiv.2008.12452,
  title  = {Misogynistic Tweet Detection: Modelling CNN with Small Datasets},
  author = {Md Abul Bashar and Richi Nayak and Nicolas Suzor and Bridget Weir},
  journal= {arXiv preprint arXiv:2008.12452},
  year   = {2020}
}