中文

用于 Tanglish 中攻击性语言识别的预训练 Transformer

计算与语言 2021-12-08 v4

摘要

本文描述了提交至 Dravidian-Codemix-HASOC2021:达罗毗荼语言(泰米尔语-英语和马来亚拉姆语-英语)中仇恨言论与攻击性语言识别的系统。该任务旨在识别从社交媒体收集的达罗毗荼语言代码混合评论/帖子中的攻击性内容。我们的方法利用预训练 transformer 多语言 BERT 的最后一层池化来完成此任务,助我们在子任务 B 的泰米尔语-英语数据集排行榜上获得第九名,加权平均分为 0.61。任务截止后,我们均匀采样数据集并使用 MuRIL 预训练模型,助我们获得 0.67 的加权平均分,为排行榜最高分。此外,我们利用预训练模型的方法有助于将我们的模型复用于不同数据集的同一任务。我们的代码与模型见 https://github.com/seanbenhur/tanglish-offensive-language-identification。

关键词

引用

@article{arxiv.2110.02852,
  title  = {Pretrained Transformers for Offensive Language Identification in Tanglish},
  author = {Sean Benhur and Kanchana Sivanraju},
  journal= {arXiv preprint arXiv:2110.02852},
  year   = {2021}
}

备注

Accepted at FIRE 2021