面向方言夹杂与语码转换环境中的微方言识别
计算与语言
2020-12-08 v2 人工智能
摘要
尽管方言预测是一项重要的语言处理任务且应用广泛,现有工作大多局限于粗粒度变体。受地理定位研究启发,我们提出了微方言识别(MDI)这一新任务,并引入了 MARBERT——一种在给定单条短消息时具有惊人能力来预测细粒度变体(可小至城市级别)的新语言模型。在建模方面,我们提供了一系列新颖的受空间与语言学驱动的多任务学习模型。为展示我们模型的效用,我们引入了一个适用于我们任务的大规模阿拉伯语微变体(低资源)新数据集。MARBERT 以 9.9% 的 F1 预测微方言,比多数类基线好约 76 倍。我们的新语言模型还在若干外部任务上确立了新的 state-of-the-art。
引用
@article{arxiv.2010.04900,
title = {Toward Micro-Dialect Identification in Diaglossic and Code-Switched Environments},
author = {Muhammad Abdul-Mageed and Chiyu Zhang and AbdelRahim Elmadany and Lyle Ungar},
journal= {arXiv preprint arXiv:2010.04900},
year = {2020}
}
备注
Accepted in EMNLP 2020