中文

使用改进交叉熵损失的多语言仇恨言论与攻击性内容检测

计算与语言 2022-02-08 v1

摘要

社交媒体用户数量的增长导致许多人滥用这些平台传播攻击性内容并使用仇恨言论。人工追踪海量帖子不切实际,因此有必要设计自动化方法快速识别它们。大语言模型在大量数据上训练,并且也利用上下文嵌入。我们对大语言模型进行微调以辅助我们的任务。数据也相当不平衡;因此我们使用了改进的交叉熵损失来解决该问题。我们观察到,使用在印地语语料上微调的模型表现更好。我们的团队(HNLP)在英语子任务 A 与英语子任务 B 中分别取得了 0.808、0.639 的宏 F1 分数。对于印地语子任务 A、印地语子任务 B,我们的团队在 HASOC 2021 中分别取得了 0.737、0.443 的宏 F1 分数。

关键词

引用

@article{arxiv.2202.02635,
  title  = {Multilingual Hate Speech and Offensive Content Detection using Modified Cross-entropy Loss},
  author = {Arka Mitra and Priyanshu Sankhala},
  journal= {arXiv preprint arXiv:2202.02635},
  year   = {2022}
}