达罗毗荼语言识别方法的比较
计算与语言
2021-03-10 v1 人工智能
机器学习
摘要
本文描述了 HWR 团队在 VarDial 2021 研讨会上组织的达罗毗荼语言识别(DLI)共享任务中的提交。DLI 训练集包含 16,674 条以罗马字母书写的 YouTube 评论,其中含有英语与三种南达罗毗荼语言(坎纳达语、马拉雅拉姆语、泰米尔语)之一的码混文本。我们提交了使用两个模型生成的结果:一个具有自适应语言模型的朴素贝叶斯分类器(已在许多语言与方言识别任务中表现出有竞争力的性能),以及一个基于 transformer 的模型(被广泛视为众多 NLP 任务中的 SOTA)。我们的首次提交在封闭提交轨道中仅使用共享任务组织者提供的训练集,而第二次提交被视为开放的,因其使用了以外部数据预训练的模型。我们的团队凭借基于朴素贝叶斯的提交在共享任务中并列第二。我们的结果强化了这样一种观点:深度学习方法在语言识别相关任务中并不像在许多其他文本分类任务中那样具有竞争力。
引用
@article{arxiv.2103.05552,
title = {Comparing Approaches to Dravidian Language Identification},
author = {Tommi Jauhiainen and Tharindu Ranasinghe and Marcos Zampieri},
journal= {arXiv preprint arXiv:2103.05552},
year = {2021}
}
备注
Accepted to VarDial 2021 @ EACL 2021