中文

用于攻击性语言检测的神经网络模型

计算与语言 2021-06-29 v1 人工智能

摘要

攻击性语言检测是一个不断发展的自然语言处理(NLP)应用。这种增长主要因为社交网络的广泛使用,其已成为人们沟通、工作和享受娱乐内容的主流渠道。许多分享攻击性与冒犯性内容的事件对社会造成了极大负面影响。我们认为,为改进和比较不同机器学习模型以对抗此类有害内容做出贡献,是本文的一项重要且具挑战性的目标。我们针对攻击性语言检测问题,旨在构建高效的自动化攻击性语言检测模型。随着NLP模型的最新进展,特别是解决了标准序列到序列技术诸多不足的Transformer模型。BERT模型已在许多NLP任务上展现出最先进(state-of-the-art)结果。尽管文献仍在探索BERT在NLP领域取得成就的原因。其他高效变体已被开发以改进标准BERT,如RoBERTa和ALBERT。此外,由于社交媒体上文本的多语言性质可能影响模型对给定推文的判定,考察诸如在100种语言上训练的XLM-RoBERTa等多语言模型及其与单语模型的比较变得至关重要。基于RoBERTa的模型被证明是最强模型,并在这些任务上取得了最高F1分数。一个完备攻击性语言检测系统的另一关键方面是模型训练与推断的速度。在这方面,我们考量了模型运行时间,并对名为BlazingText的FastText非常高效的实现进行了微调,其取得了良好结果,且远快于基于BERT的模型。

关键词

引用

@article{arxiv.2106.14609,
  title  = {Neural Models for Offensive Language Detection},
  author = {Ehab Hamdy},
  journal= {arXiv preprint arXiv:2106.14609},
  year   = {2021}
}