中文

indicnlp@kgp 在 DravidianLangTech-EACL2021 的任务:达罗毗荼语言中的攻击性语言识别

计算与语言 2021-02-16 v1

摘要

本文介绍了 indicnlp@kgp 团队向 EACL 2021 共享任务“达罗毗荼语言中的攻击性语言识别”的提交。该任务旨在对 3 个码混达罗毗荼语言数据集中的不同攻击性内容类型进行分类。本工作通过纳入额外数据及在预训练模型上的迁移学习,利用了文本分类中现有的最先进方法。我们的最终提交是基于 AWD-LSTM 的模型与基于 BERT 和 RoBERTa 的两种不同 transformer 模型架构的集成。我们在 Malayalam-English、Tamil-English 和 Kannada-English 数据集上分别取得了 0.97、0.77 和 0.72 的加权平均 F1 分数,在各自任务中分别排名第 1、第 2 和第 3。

关键词

引用

@article{arxiv.2102.07150,
  title  = {indicnlp@kgp at DravidianLangTech-EACL2021: Offensive Language Identification in Dravidian Languages},
  author = {Kushal Kedia and Abhilash Nandy},
  journal= {arXiv preprint arXiv:2102.07150},
  year   = {2021}
}