真实场景下的阿拉伯方言识别
计算与语言
2020-05-18 v2
摘要
我们提出 QADI,一个自动收集的推文数据集,属于广泛的国别级阿拉伯方言——覆盖中东和北非地区的 18 个不同国家。我们构建该数据集的方法依赖于应用多个过滤器,根据用户账户描述识别属于不同国家的用户,并剔除用现代标准阿拉伯语书写或含有不当语言的推文。所得数据集包含来自 2,525 名用户的 540k 条推文,这些用户在 18 个阿拉伯国家中均匀分布。通过内在评估,我们显示一组随机选取推文的标签准确率为 91.5%。对于外在评估,我们能够构建有效的推文国别级方言识别模型,在 18 个类别上的宏平均 F1 分数为 60.6%。
引用
@article{arxiv.2005.06557,
title = {Arabic Dialect Identification in the Wild},
author = {Ahmed Abdelali and Hamdy Mubarak and Younes Samih and Sabit Hassan and Kareem Darwish},
journal= {arXiv preprint arXiv:2005.06557},
year = {2020}
}
备注
13 pages, 7 figures, 4 tables