中文

用于印地语文本敌意检测的深度学习模型评估

计算与语言 2021-06-01 v4 机器学习

摘要

社交媒体平台是表达个人想法和分享有用信息的便捷媒介。它快速、简洁,并且能够触达数百万用户。它是一个归档想法、分享艺术内容、接收反馈、推广产品等的有效场所。尽管具有诸多优势,这些平台也助长了敌意帖子的传播。出于个人满足或政治利益,仇恨言论和贬损性言论被发布。敌意帖子可能产生欺凌效应,使整个平台体验变得充满敌意。因此,检测敌意帖子对于维护社交媒体环境至关重要。该问题在印地语等低资源语言中更为突出。在这项工作中,我们提出了用于印地语敌意文本检测的方法。所提方法在 Constraint@AAAI 2021 印地语敌意检测数据集上进行了评估。该数据集包含从社交媒体平台收集的敌意和非敌意文本。敌意帖子进一步被划分为虚假、攻击性、仇恨和诽谤的重叠类别。我们针对这一多标签分类问题评估了一系列基于 CNN、LSTM 和 BERT 的深度学习方法。IndicNLP 和 Facebook 的预训练印地语 fast text 词嵌入与 CNN 和 LSTM 模型结合使用。使用了两种预训练多语言Transformer语言模型 mBERT 和 IndicBERT 的变体。我们表明基于 BERT 的模型性能最佳。此外,CNN 和 LSTM 模型也与基于 BERT 的模型具有竞争性表现。

关键词

引用

@article{arxiv.2101.04144,
  title  = {Evaluation of Deep Learning Models for Hostility Detection in Hindi Text},
  author = {Ramchandra Joshi and Rushabh Karnavat and Kaustubh Jirapure and Raviraj Joshi},
  journal= {arXiv preprint arXiv:2101.04144},
  year   = {2021}
}

备注

Accepted at IEEE I2CT 2021