社交媒体中的可定位命名实体识别
计算与语言
2014-08-05 v1
摘要
我们提出了一种识别所谓可定位命名实体的新方法;即位于目标集合(例如电影、书籍、电视节目)中的命名实体。与许多其他需要在有新实体出现时重新训练统计模型的命名实体识别(NER)系统不同,我们的方法不需要此类重新训练,这使得它更适用于频繁更新的实体类型。在这项初步研究中,我们使用从 Twitter 收集的数据,专注于一种实体类型:电影标题。我们的系统在两个评估集上进行了测试,一个仅包含对应于我们训练集中电影的实体,另一个则排除任何此类实体。我们的最终模型在这些评估集上的 F1 分数分别为 76.19% 和 78.70%,这有力地证明了我们的方法对训练期间发现的任何特定实体集完全无偏。
引用
@article{arxiv.1408.0782,
title = {Targetable Named Entity Recognition in Social Media},
author = {Sandeep Ashwini and Jinho D. Choi},
journal= {arXiv preprint arXiv:1408.0782},
year = {2014}
}