CUSATNLP团队在HASOC-Dravidian-CodeMix-FIRE2020任务中识别Manglish推文中的攻击性语言
计算与语言
2020-10-20 v1
摘要
随着社交媒体的普及,通过博客、Facebook、Twitter及其他平台的交流日益增多。最初,英语是唯一的交流媒介。幸运的是,现在我们可以用任何语言交流。这导致人们以混合形式使用英语和自己的母语或本族语。有时,其他语言的评论采用英语转写形式,或在其他情况下人们使用目标语言的文字系统。从此类混合代码推文中识别情感和攻击性内容在当今是一项必要任务。我们提交了一个工作模型,用于2020年信息检索评测论坛(FIRE)中HASOC攻击性语言识别子赛道DravidianCodeMix的任务2。这是一个消息级分类任务。在我们的方法中,一个基于嵌入模型的分类器识别攻击性和非攻击性评论。我们将此方法应用于该子赛道提供的Manglish数据集。
引用
@article{arxiv.2010.08756,
title = {CUSATNLP@HASOC-Dravidian-CodeMix-FIRE2020:Identifying Offensive Language from ManglishTweets},
author = {Sara Renjit and Sumam Mary Idicula},
journal= {arXiv preprint arXiv:2010.08756},
year = {2020}
}