中文

利用命名实体识别与共指消解进行英语和希腊语文本分割

计算与语言 2016-10-31 v1 信息检索

摘要

本文考察了对用于文本分割的英语和希腊语语料库执行命名实体识别 (NER) 和共指消解的益处。此处的目的是检验文本分割与信息提取的结合是否有利于识别文档中出现的各种主题。我们在英语语料库上手动执行了 NER,并将其与公开可用的标注工具产生的输出进行了比较;而对于希腊语语料库,则使用了现有工具。来自两个语料库的生成标注均经过人工校正和丰富,以涵盖四种类型的命名实体。随后进行了共指消解,即用相同的命名实体标识符替换同一实例的每个引用。使用五种文本分割算法评估英语语料库,使用四种算法评估希腊语语料库,得出的结论是:其益处高度依赖于段落的主题、其中出现的命名实体实例数量以及段落的长度。

关键词

引用

@article{arxiv.1610.09226,
  title  = {Text Segmentation using Named Entity Recognition and Co-reference Resolution in English and Greek Texts},
  author = {Pavlina Fragkou},
  journal= {arXiv preprint arXiv:1610.09226},
  year   = {2016}
}

备注

32 pages. arXiv admin note: text overlap with arXiv:1308.0661, arXiv:1204.2847 by other authors