中文

用于辱骂性语言检测的神经网络词分解模型

计算与语言 2019-10-03 v1

摘要

社交媒体上的用户生成文本常常带有许多不良特征,包括仇恨言论、辱骂性语言、侮辱性等,旨在攻击或辱骂特定群体。与新闻等传统文本相比,此类文本通常写法不同,既可能涉及辱骂词的显式提及、混淆词与拼写错误,也可能涉及隐性辱骂,即暗示或针对负面刻板印象。因此,当我们应用为传统文本开发的自然语言处理技术来处理此类文本时,会面临若干鲁棒性挑战。例如,使用基于词或词元的模型处理此类文本,可能将同一词的两个拼写变体视为两个不同的词。继近期工作之后,我们分析字符、子词和字节对编码(BPE)模型如何有助于应对用户生成文本带来的部分挑战。在我们的工作中,我们分析上述每种技术的有效性,比较并对比各种词分解技术在相互结合使用时的表现。我们尝试微调大型预训练语言模型,并通过研究 Wikipedia 攻击、毒性和 Twitter 仇恨言论数据集,展示它们对领域偏移的鲁棒性。

关键词

引用

@article{arxiv.1910.01043,
  title  = {Neural Word Decomposition Models for Abusive Language Detection},
  author = {Sravan Babu Bodapati and Spandana Gella and Kasturi Bhattacharjee and Yaser Al-Onaizan},
  journal= {arXiv preprint arXiv:1910.01043},
  year   = {2019}
}

备注

Accepted at ALW Workshop at ACL2019, Florence; BERT has a WordPiece model and it enhances performance of word based models in noisy settings