中文

利用伪标签在低资源代码混合达罗毗荼语言中进行攻击性语言辨识

计算与语言 2021-08-30 v1

摘要

社交媒体已有效成为通信与数字营销的主要枢纽。由于这些平台允许以文本、图像和视频形式自由表达想法与事实,亟需对其内容进行筛查,以保护个人与群体免受针对他们的攻击性内容侵害。我们的工作旨在对泰米尔语、卡纳达语和马拉雅拉姆语等达罗毗荼语言的代码混合社交媒体评论/帖子进行分类。我们意图通过在数据集上生成伪标签来改进攻击性语言辨识。我们通过将所有代码混合文本音译为相应的达罗毗荼语言(卡纳达语、马拉雅拉姆语或泰米尔语之一),随后为音译后的数据集生成伪标签,从而构建自定义数据集。利用生成的伪标签将两份数据集合并,创建名为 CMTRA 的自定义数据集。由于达罗毗荼语言资源不足,我们的方法增加了语言模型的训练数据量。我们在新构建的数据集上微调了若干近期预训练语言模型。我们提取预训练语言嵌入并将其送入循环神经网络。我们观察到,在自定义数据集上微调 ULMFiT 在所有三种语言的代码混合测试集上均取得最佳结果。我们的方法在泰米尔语-英语上取得基准模型中的最佳结果,加权 F1 分数达 0.7934,同时在马拉雅拉姆语-英语和卡纳达语-英语的代码混合测试集上分别取得 0.9624 和 0.7306 的具竞争力的加权 F1 分数。

关键词

引用

@article{arxiv.2108.12177,
  title  = {Offensive Language Identification in Low-resourced Code-mixed Dravidian languages using Pseudo-labeling},
  author = {Adeep Hande and Karthik Puranik and Konthala Yasaswini and Ruba Priyadharshini and Sajeetha Thavareesan and Anbukkarasi Sampath and Kogilavani Shanmugavadivel and Durairaj Thenmozhi and Bharathi Raja Chakravarthi},
  journal= {arXiv preprint arXiv:2108.12177},
  year   = {2021}
}

备注

27 pages, 12 figures, 10 tables