中文

真实场景下的阿拉伯方言识别

计算与语言 2020-05-18 v2

摘要

我们提出 QADI,一个自动收集的推文数据集,属于广泛的国别级阿拉伯方言——覆盖中东和北非地区的 18 个不同国家。我们构建该数据集的方法依赖于应用多个过滤器,根据用户账户描述识别属于不同国家的用户,并剔除用现代标准阿拉伯语书写或含有不当语言的推文。所得数据集包含来自 2,525 名用户的 540k 条推文,这些用户在 18 个阿拉伯国家中均匀分布。通过内在评估,我们显示一组随机选取推文的标签准确率为 91.5%。对于外在评估,我们能够构建有效的推文国别级方言识别模型,在 18 个类别上的宏平均 F1 分数为 60.6%。

关键词

引用

@article{arxiv.2005.06557,
  title  = {Arabic Dialect Identification in the Wild},
  author = {Ahmed Abdelali and Hamdy Mubarak and Younes Samih and Sabit Hassan and Kareem Darwish},
  journal= {arXiv preprint arXiv:2005.06557},
  year   = {2020}
}

备注

13 pages, 7 figures, 4 tables