利用图像与文本在 Twitter 中进行命名实体识别
信息检索
2017-10-31 v1 计算与语言
摘要
命名实体识别(NER)是信息抽取的一个重要子任务,旨在定位并识别命名实体。尽管近期取得进展,我们仍面临正确检测和分类实体的局限,尤其在如 Twitter 这样的短而嘈杂的文本中尤为突出。大多数 NER 方法的一个重要负面方面是对手工特征和领域特定知识的高依赖,而这是取得最先进(state-of-the-art)结果所必需的。因此,设计处理此类语言复杂上下文的模型仍具挑战性。本文中,我们提出一种不依赖任何特定语言资源或编码规则的新颖多级架构。不同于传统方法,我们使用从图像和文本中提取的特征来对命名实体分类。在 Ritter 数据集上针对 Twitter 最先进 NER 的实验测试给出了有竞争力的结果(0.59 F-measure),表明该方法可能通向更好的 NER 模型。
引用
@article{arxiv.1710.11027,
title = {Named Entity Recognition in Twitter using Images and Text},
author = {Diego Esteves and Rafael Peres and Jens Lehmann and Giulio Napolitano},
journal= {arXiv preprint arXiv:1710.11027},
year = {2017}
}
备注
The 3rd International Workshop on Natural Language Processing for Informal Text (NLPIT 2017), 8 pages