中文

Gauravarora@HASOC-Dravidian-CodeMix-FIRE2020:在合成生成的码混合数据上预训练 ULMFiT 用于仇恨言论检测

计算与语言 2020-10-21 v2

摘要

本文描述了提交至 Dravidian-Codemix-HASOC2020 的系统:达罗毗荼语言(泰米尔语-英语和马来alam语-英语)中的仇恨言论与攻击性内容识别。该任务旨在从社交媒体收集的达罗毗荼语言码混合评论/帖子数据集中识别攻击性语言。我们参与了两个子任务:子任务 A 旨在识别混合文字(母语文字与罗马文字混合)中的攻击性内容,子任务 B 旨在识别罗马文字中的攻击性内容,均针对达罗毗荼语言。为应对这些任务,我们提出在合成生成的码混合数据上预训练 ULMFiT,该数据通过将码混合数据生成建模为使用马尔可夫链的马尔可夫过程而生成。我们的模型在子任务 B 的码混合泰米尔语-英语语言上取得了 0.88 的加权 F1 分数,并在排行榜上获得第 2 名。此外,我们的模型在子任务 A 的混合文字马来alam语-英语上取得 0.91 的加权 F1 分数(第 4 名),在子任务 B 的码混合马来alam语-英语语言上取得 0.74 的加权 F1 分数(第 5 名)。

关键词

引用

@article{arxiv.2010.02094,
  title  = {Gauravarora@HASOC-Dravidian-CodeMix-FIRE2020: Pre-training ULMFiT on Synthetically Generated Code-Mixed Data for Hate Speech Detection},
  author = {Gaurav Arora},
  journal= {arXiv preprint arXiv:2010.02094},
  year   = {2020}
}

备注

System description paper for 2nd ranked system in Sub-task B accepted at Dravidian-Codemix-HASOC2020@FIRE2020