中文

推文命名实体识别与链接分析

计算与语言 2014-11-26 v1

摘要

应用自然语言处理进行推文(一种微博形式)挖掘和智能信息访问是一个具有挑战性的新兴研究领域。与精心撰写的新闻文本和其他较长内容不同,推文由于其简短、嘈杂、依赖上下文和动态的特性,带来了一系列新挑战。推文中的信息提取通常在流水线中执行,包括语言识别、分词、词性标注、命名实体识别和实体消歧(例如相对于 DBpedia)等连续阶段。在这项工作中,我们描述了一个新的推文实体消歧数据集,并对命名实体识别和消歧进行了实证分析,调查了若干最先进系统在此类嘈杂文本上的鲁棒性、主要错误来源是什么,以及应进一步研究哪些问题以改进最先进水平。

关键词

引用

@article{arxiv.1410.7182,
  title  = {Analysis of Named Entity Recognition and Linking for Tweets},
  author = {Leon Derczynski and Diana Maynard and Giuseppe Rizzo and Marieke van Erp and Genevieve Gorrell and Raphaël Troncy and Johann Petrak and Kalina Bontcheva},
  journal= {arXiv preprint arXiv:1410.7182},
  year   = {2014}
}

备注

35 pages, accepted to journal Information Processing and Management