中文

GeoTextTagger:基于自然语言处理方法的文本文档高精度位置标注

人工智能 2016-01-25 v1 计算与语言 数据库 信息检索

摘要

位置标注,也称为地理标注(geotagging)或地理定位(geolocation),是将地理坐标分配给输入数据的过程。本文中,我们提出了一种用于文本文档位置标注的算法。我们的方法利用了自然语言处理领域的先前工作,使用最先进的词性标注器和命名实体识别器来寻找可能指代位置的文本块。随后使用知识库(OpenStreatMap)为每个文本块查找可能位置的列表。最后,通过为每个位置分配基于距离的分数,并反复选择具有最佳分数的位置和文本块,为每个块选择一个位置。我们使用具有明确定义地理位置且由文章作者进行了地理标注的维基百科文章测试了我们的地理定位算法,此类文章中分类方法已实现低至 11 km 的中位误差,其可达精度受类别大小限制。在我们的维基百科数据集上,我们的方法实现了 490 米的第10百分位误差和 54 公里的中位误差。当考虑得分最高的五个位置标注时,50% 的文章被分配了至少一个距文章作者指定的真实位置 8.5 公里以内的标注。我们还在标有发送位置信息的 Twitter 消息上测试了我们的方法。Twitter 文本具有挑战性,因为它们简短且无结构,且常不包含指代发送位置的词语,但我们获得了潜在有用的结果。我们解释了如何使用 Spark 框架进行数据分析以收集和处理测试数据。总体而言,基于分类的位置标注方法可能正达到其精度上限,而我们聚焦精度的方法对某些文本具有高准确度,并展现出整体显著改进潜力。

关键词

引用

@article{arxiv.1601.05893,
  title  = {GeoTextTagger: High-Precision Location Tagging of Textual Documents using a Natural Language Processing Approach},
  author = {Shawn Brunsting and Hans De Sterck and Remco Dolman and Teun van Sprundel},
  journal= {arXiv preprint arXiv:1601.05893},
  year   = {2016}
}