中文

Optimize_Prime@DravidianLangTech-ACL2022:泰米尔语中的滥用评论检测

计算与语言 2022-04-22 v1

摘要

本文试图解决低资源印度语言中的滥用评论检测问题。滥用评论是针对某人或某群体具有攻击性的陈述。这些评论针对属于特定族群、性别、种姓、种族、性取向等的个体。滥用评论检测是一个重要问题,尤其随着近期社交媒体用户的增长。本文介绍了我们的团队Optimize_Prime在ACL 2022共享任务“泰米尔语滥用评论检测”中使用的方法。该任务检测并将泰米尔语及泰米尔-英语混合码(Code-mixed)格式的YouTube评论分类为多个类别。我们使用了三种方法来优化结果:集成模型、循环神经网络(RNN)与Transformer。在泰米尔语数据中,MuRIL与XLM-RoBERTA是我们表现最佳的模型,宏平均f1分数为0.43。此外,对于混合码数据,MuRIL与M-BERT给出了极佳的结果,宏平均f1分数为0.45。

关键词

引用

@article{arxiv.2204.09675,
  title  = {Optimize_Prime@DravidianLangTech-ACL2022: Abusive Comment Detection in Tamil},
  author = {Shantanu Patankar and Omkar Gokhale and Onkar Litake and Aditya Mandke and Dipali Kadam},
  journal= {arXiv preprint arXiv:2204.09675},
  year   = {2022}
}

备注

arXiv admin note: text overlap with arXiv:2204.09087