中文

达罗毗荼语言中恐同与恐跨内容的检测:探索深度学习方法

计算与语言 2023-04-05 v1 机器学习

摘要

在线社交媒体平台上滥用内容的增加正在影响在线用户的社交生活。攻击性和仇恨言论的使用使社交媒体变得有毒。恐同和恐跨构成针对 LGBT+ 群体的攻击性评论。及时标记或警告从事此类行为的用户变得必不可少。然而,此类内容的自动检测是一项具有挑战性的任务,在被视为低资源语言的达罗毗荼语言中更是如此。受此驱动,本文尝试探索不同深度学习模型对于马来语(Malayalam)和泰米尔语(Tamil)社交媒体评论分类为恐同、恐跨和非反 LGBT+ 内容的适用性。将常用的深度学习模型——卷积神经网络(CNN)、使用 GloVe 嵌入的长短期记忆网络(LSTM)以及基于 transformer 的学习模型(多语言 BERT 和 IndicBERT)应用于该分类问题。所得结果显示 IndicBERT 优于其他已实现的模型,在马来语和泰米尔语上分别获得了 0.86 和 0.77 的加权平均 F1 分数。因此,本工作证实了 IndicBERT 在给定达罗毗荼语言任务上的更优性能。

关键词

引用

@article{arxiv.2304.01241,
  title  = {Detection of Homophobia & Transphobia in Dravidian Languages: Exploring Deep Learning Methods},
  author = {Deepawali Sharma and Vedika Gupta and Vivek Kumar Singh},
  journal= {arXiv preprint arXiv:2304.01241},
  year   = {2023}
}