用于多语言方言检测的两阶段流水线
计算与语言
2023-03-29 v2 人工智能
摘要
方言识别是本地化各类大语言模型(LLM)的关键任务。本文概述了我们参与VarDial 2023共享任务的方法。在此我们需从三种语言中每种识别三个或两个方言,分别对应Track-1的9分类与Track-2的6分类。我们提出的方法由两阶段系统组成,优于该领域其他参与者的系统及以往工作。我们在Track-1取得58.54%的分数,在Track-2取得85.61%的分数。我们的代码库公开可用(https://github.com/ankit-vaidya19/EACL_VarDial2023)。
引用
@article{arxiv.2303.03487,
title = {Two-stage Pipeline for Multilingual Dialect Detection},
author = {Ankit Vaidya and Aditya Kane},
journal= {arXiv preprint arXiv:2303.03487},
year = {2023}
}