中文

Arap-Tweet:用于性别、年龄与语言变体识别的大型多方言推特语料库

计算与语言 2018-08-24 v1

摘要

在本文中,我们提出 Arap-Tweet,这是一个来自阿拉伯世界 11 个地区与 16 个国家、代表主要阿拉伯方言变体的大规模多方言推特语料库。为构建该语料库,我们从 Twitter 收集数据,并为一组经验丰富的标注员提供标注指南,用于对方言变体、年龄类别与性别进行标注。在数据收集过程中,我们基于各阿拉伯方言特有的区别性关键词进行检索,并利用 Twitter API 对位置进行验证。本文报告了语料库数据收集与标注工作,也呈现了这些阶段中遇到的一些问题。随后,我们给出为确保标注一致性所进行评估的结果。所提供的语料库将丰富阿拉伯语有限的可用语言资源,并成为开发阿拉伯语作者画像工具与 NLP 工具的宝贵助力。

关键词

引用

@article{arxiv.1808.07674,
  title  = {Arap-Tweet: A Large Multi-Dialect Twitter Corpus for Gender, Age and Language Variety Identification},
  author = {Wajdi Zaghouani and Anis Charfi},
  journal= {arXiv preprint arXiv:1808.07674},
  year   = {2018}
}

备注

Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018)