中文

基于条件随机场的保加利亚语特征丰富命名实体识别

计算与语言 2021-10-01 v1 人工智能 机器学习

摘要

本文提出一种特征丰富的方法,用于保加利亚语新闻文本中命名实体(人物、组织、地点及其他)的自动识别与分类。我们将其他语言中成熟使用的特征与语言特定的词汇、句法和形态信息相结合。特别地,我们利用 BulTreeBank 的丰富标注集(680 个形态句法标签),从中导出适合任务的特定标签集(局部与非局部)。我们进一步加入领域特定的地名词典和额外的无标注数据,取得了 F1=89.4% 的结果,可与英语的最先进结果相媲美。

关键词

引用

@article{arxiv.2109.15121,
  title  = {Feature-Rich Named Entity Recognition for Bulgarian Using Conditional Random Fields},
  author = {Georgi Georgiev and Preslav Nakov and Kuzman Ganchev and Petya Osenova and Kiril Ivanov Simov},
  journal= {arXiv preprint arXiv:2109.15121},
  year   = {2021}
}

备注

named entity recognition, NER, conditional random fields, CRF, Bulgarian, BulTreeBank