中文

ANETAC:阿拉伯语命名实体音译与分类数据集

计算与语言 2019-07-09 v1 信息检索

摘要

在本文中,我们公开提供 ANETAC,这是我们基于免费可用的平行翻译语料库构建的英阿命名实体音译与分类数据集。该数据集包含 79,924 个实例,每个实例为一个三元组 (e, a, c),其中 e 为英文命名实体,a 为其阿拉伯语音译,c 为其类别,可以是人物(Person)、地点(Location)或组织(Organization)。ANETAC 数据集主要面向从事阿拉伯语命名实体音译的研究人员,但也可用于命名实体分类任务。

关键词

引用

@article{arxiv.1907.03110,
  title  = {ANETAC: Arabic Named Entity Transliteration and Classification Dataset},
  author = {Mohamed Seghir Hadj Ameur and Farid Meziane and Ahmed Guessoum},
  journal= {arXiv preprint arXiv:1907.03110},
  year   = {2019}
}