pioNER:亚美尼亚语命名实体识别的数据集与基线
计算与语言
2020-09-29 v1
摘要
在这项工作中,我们解决亚美尼亚语命名实体识别问题,提供 silver-standard 与 gold-standard 数据集,并在流行模型上建立基线结果。我们呈现一个从维基百科自动生成并标注的 163000 词元的命名实体语料库,以及另一个 53400 词元的新闻句子语料库,含有人、组织与地点命名实体的人工标注。这些语料库被用于训练和评估若干流行的命名实体识别模型。除数据集外,我们发布了在维基百科、新闻、博客与百科全书的亚美尼亚语文本集合上训练的 50、100、200、300 维 GloVe 词嵌入。
引用
@article{arxiv.1810.08699,
title = {pioNER: Datasets and Baselines for Armenian Named Entity Recognition},
author = {Tsolak Ghukasyan and Garnik Davtyan and Karen Avetisyan and Ivan Andrianov},
journal= {arXiv preprint arXiv:1810.08699},
year = {2020}
}
备注
Accepted paper at Ivannikov ISP RAS Open Conference 2018. \c{opyright} 2018 IEEE