文本中的位置指称识别:综述与比较
计算与语言
2022-07-06 v1
摘要
海量位置信息存在于非结构化文本中,例如社交媒体帖子、新闻故事、科学文章、网页、旅行博客和历史档案。地理解析(geoparsing)是指从文本中识别位置指称并确定其地理空间表示的过程。尽管地理解析可惠及诸多领域,但其具体应用的总结仍然缺失。此外,针对位置指称识别(地理解析的首要且核心步骤)的现有方法,缺乏全面的综述与比较。为填补这些研究空白,本综述首先总结了地理解析的七个典型应用领域:地理信息检索、灾害管理、疾病监测、交通管理、空间人文、旅游管理和犯罪管理。随后,我们根据底层功能原理将现有位置指称识别方法分为四类:基于规则、基于地名辞典匹配、基于统计学习以及混合方法。接下来,基于包含全球 39,736 个位置指称、涵盖不同类型文本(如社交媒体帖子和新闻故事)的 26 个公共数据集,我们全面评估了 27 种最广泛使用的方法的正确性与计算效率。该全面评估的结果有助于指导位置指称识别的未来方法学发展,并可根据应用需求协助选择合适的方法。
引用
@article{arxiv.2207.01683,
title = {Location reference recognition from texts: A survey and comparison},
author = {Xuke Hu and Zhiyong Zhou and Hao Li and Yingjie Hu and Fuqiang Gu and Jens Kersten and Hongchao Fan and Friederike Klan},
journal= {arXiv preprint arXiv:2207.01683},
year = {2022}
}
备注
35 pages, 11 figures