利用基于地名录的统计语言模型从目标文本流中提取地名
计算与语言
2020-04-28 v3
摘要
从非正式且非结构化的社交媒体数据中提取地名需要识别指称边界并切分复合名称。地名的变异性,特别是系统性变异性(Carroll, 1983),给识别任务带来了挑战。其中一些变异性可以作为统计语言模型内的操作来预测,在本例中,该模型从 OpenStreetMap (OSM)、Geonames 和 DBpedia 等地名录中提取。这允许将 Twitter 目标文本中观察到的 n-gram 评估为来自相同位置上下文的合法地名变体。利用 n-gram 统计和位置相关词典,我们的 Location Name Extraction 工具 (LNEx) 处理缩写,并自动过滤和增补地名录中的地名(处理名称缩略和辅助内容),以帮助检测多词地名的边界从而在文本中对其进行界定。我们在来自三个目标流的 4,500 条特定事件推文上评估了我们的方法,以比较 LNEx 与十种依赖标准语义、句法和/或正字特征的 state-of-the-art 标注器的性能。LNEx 将平均 F-Score 提高了 33-179%,优于所有标注器。此外,LNEx 具备流处理能力。
引用
@article{arxiv.1708.03105,
title = {Location Name Extraction from Targeted Text Streams using Gazetteer-based Statistical Language Models},
author = {Hussein S. Al-Olimat and Krishnaprasad Thirunarayan and Valerie Shalin and Amit Sheth},
journal= {arXiv preprint arXiv:1708.03105},
year = {2020}
}
备注
https://www.aclweb.org/anthology/C18-1169.pdf