DN 在 SemEval-2023 任务 12:基于多语言预训练语言模型微调的低资源语言文本分类
计算与语言
2023-09-19 v1
摘要
近年来,情感分析在自然语言处理中日益重要。然而,多数现有情感分析模型与数据集针对高资源语言(如英语与中文)开发,低资源语言尤其是非洲语言大多未被探索。AfriSenti-SemEval 2023 共享任务 12 旨在通过在低资源非洲语言上评估情感分析模型填补此空白。本文给出我们对该共享任务的解决方案,其中我们采用了不同的多语言 XLM-R 模型,并在多种数据上训练分类头,包括以非洲方言重训练并在目标语言上微调的数据。我们的团队在子任务 B、赛道 16:多语言中取得第三佳结果,证明了方法的有效性。尽管我们的模型在多语言数据上表现相对良好,其在部分语言中表现较差。我们的发现凸显了开发更全面的低资源非洲语言数据集与模型以推进情感分析研究的重要性。我们亦在 github 仓库提供了解决方案。
引用
@article{arxiv.2305.02607,
title = {DN at SemEval-2023 Task 12: Low-Resource Language Text Classification via Multilingual Pretrained Language Model Fine-tuning},
author = {Daniil Homskiy and Narek Maloyan},
journal= {arXiv preprint arXiv:2305.02607},
year = {2023}
}