基于 spaCy 的希腊语词性标注与实体识别开源系统的设计与实现
计算与语言
2019-12-24 v1 信息检索
机器学习
机器学习
摘要
本文提出一种针对希腊语的词性标注与命名实体识别的机器学习方法,侧重于形态特征的提取以及将词元分类为少量命名实体类别。文中介绍了所采用的架构模型。我们将 spaCy 平台的希腊语版本加入源代码(此功能在我们贡献之前并不存在),并用于构建模型。此外,我们训练了一个词性标注器,能够检测词元的形态,并且在仅分类词性时表现优于当前最优结果。对于使用 spaCy 的命名实体识别,我们构建了一个扩展标准 ENAMEX 类型(组织、地点、人物)的模型。所进行的若干实验表明了对集外词灵活性的需求,并且我们致力于解决该问题。最后,讨论了评估结果。
引用
@article{arxiv.1912.10162,
title = {Design and implementation of an open source Greek POS Tagger and Entity Recognizer using spaCy},
author = {Eleni Partalidou and Eleftherios Spyromitros-Xioufis and Stavros Doropoulos and Stavros Vologiannidis and Konstantinos I. Diamantaras},
journal= {arXiv preprint arXiv:1912.10162},
year = {2019}
}