中文

基于 CRF 的命名实体识别 @ICON 2013

计算与语言 2014-09-30 v1

摘要

本文描述了作为 ICON 2013 共享任务一部分的基于条件随机场 (CRF) 的系统在印度语言命名实体识别 (NER) 中的性能。在该任务中,我们对所有语言考虑了一组语言无关的特征。仅对英语添加了一种特定于语言的特征,即大写。接下来,探索了词典在孟加拉语、印地语和英语中的使用。这些词典构建自维基百科和其他来源。测试结果显示,该系统在英语上达到了最高的 F 值 88%,而在泰米尔语和泰卢固语上达到了最低的 F 值 69%。值得注意的是,对于表现最差的两种语言,未使用词典。孟加拉语和印地语的 NER 准确率(F 值)分别为 87% 和 79%。

关键词

引用

@article{arxiv.1409.8008,
  title  = {CRF-based Named Entity Recognition @ICON 2013},
  author = {Arjun Das and Utpal Garain},
  journal= {arXiv preprint arXiv:1409.8008},
  year   = {2014}
}