Mavericks 团队在 NADI 2023 共享任务中的工作:基于 Transformer 方法通过方言识别解析地区细微差异
计算与语言
2023-12-01 v1
摘要
在本文中,我们介绍了针对“细粒度阿拉伯语方言识别(NADI)共享任务 2023”的方法。我们重点阐述了处理国家级方言识别的子任务 1 的方法。识别方言在提升语音识别与翻译等多种下游 NLP 任务性能方面发挥着重要作用。该任务使用涵盖 18 种方言用于多类分类问题的 Twitter 数据集(TWT-2023)。我们采用了多种基于 Transformer、在阿拉伯语上预训练的模型来识别国家级方言。我们在所给数据集上对这些最先进的模型进行微调。利用集成方法提升系统性能。我们在测试数据集上取得了 76.65 的 F1 分数(排行榜第 11 名)。
引用
@article{arxiv.2311.18739,
title = {Mavericks at NADI 2023 Shared Task: Unravelling Regional Nuances through Dialect Identification using Transformer-based Approach},
author = {Vedant Deshpande and Yash Patwardhan and Kshitij Deshpande and Sudeep Mangalvedhekar and Ravindra Murumkar},
journal= {arXiv preprint arXiv:2311.18739},
year = {2023}
}
备注
5 pages, 1 figure, accepted at the NADI ArabicNLP Workshop, EMNLP 2023