中文

阿拉伯语作者画像的标注指南与标注框架

计算与语言 2018-08-24 v1

摘要

在本文中,我们呈现了作为从覆盖 16 个阿拉伯国家和 11 个方言区的各类社交媒体来源创建大型人工标注阿拉伯语作者画像数据集工作一部分的标注流程与我们编写的指南。标注后的 ARAP-Tweet 语料库目标规模超过 240 万词。我们阐述并总结了针对所选各方言区的一般性及方言特异性指南。我们还呈现了标注框架与后勤安排。我们在标注过程中通过频繁计算标注者间一致性来控制标注质量。最后,我们描述了标注阶段遇到的问题,尤其是那些与社交媒体中使用的阿拉伯语方言变体特性相关的问题。

关键词

引用

@article{arxiv.1808.07678,
  title  = {Guidelines and Annotation Framework for Arabic Author Profiling},
  author = {Wajdi Zaghouani and Anis Charfi},
  journal= {arXiv preprint arXiv:1808.07678},
  year   = {2018}
}

备注

Proceedings of the Eleventh International Conference on Language Resources and Evaluation (LREC 2018), The 3rd Workshop on Open-Source Arabic Corpora and Processing Tools: with ArabicWeb16 Data Challenge. arXiv admin note: text overlap with arXiv:1808.07674