Arap-Tweet:用于性别、年龄与语言变体识别的大型多方言推特语料库
计算与语言
2018-08-24 v1
摘要
在本文中,我们提出 Arap-Tweet,这是一个来自阿拉伯世界 11 个地区与 16 个国家、代表主要阿拉伯方言变体的大规模多方言推特语料库。为构建该语料库,我们从 Twitter 收集数据,并为一组经验丰富的标注员提供标注指南,用于对方言变体、年龄类别与性别进行标注。在数据收集过程中,我们基于各阿拉伯方言特有的区别性关键词进行检索,并利用 Twitter API 对位置进行验证。本文报告了语料库数据收集与标注工作,也呈现了这些阶段中遇到的一些问题。随后,我们给出为确保标注一致性所进行评估的结果。所提供的语料库将丰富阿拉伯语有限的可用语言资源,并成为开发阿拉伯语作者画像工具与 NLP 工具的宝贵助力。
引用
@article{arxiv.1808.07674,
title = {Arap-Tweet: A Large Multi-Dialect Twitter Corpus for Gender, Age and Language Variety Identification},
author = {Wajdi Zaghouani and Anis Charfi},
journal= {arXiv preprint arXiv:1808.07674},
year = {2018}
}
备注
Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018)