中文

公共交通站点相似性分类

数据库 2021-01-01 v1 机器学习

摘要

我们研究如下问题:给定两个公共交通站点标识符 A 和 B,每个均带有标签和地理坐标,判断 A 和 B 是否描述同一站点。例如,对于位于 (51.5306, -0.1253) 的“St Pancras International”和位于 (51.5319, -0.1269) 的“London St Pancras”,答案为“是”。该问题在使用公共交通数据的领域中频繁出现,例如地理信息系统、时刻表合并、路线规划或地图匹配。我们考虑了若干基于地理距离和简单字符串相似度度量的基线方法,也尝试了更精细的字符串相似度度量以及人工创建的归一化规则。实验表明,这些基线方法结果良好但不完全令人满意。因此我们开发了一种基于随机森林分类器的方法,其训练特征为两个站点之间匹配的三元组、它们的距离以及它们在交织网格上的位置。所有方法均在由 OpenStreetMap (OSM) 数据生成的广泛真实数据集上评估:(1) 大不列颠与爱尔兰的并集;(2) 德国、瑞士和奥地利的并集。在所有数据集上,我们基于学习的方法取得了超过 99% 的 F1 分数,而即便最精细的基线方法(基于 TFIDF 分数和地理距离)的 F1 分数至多 94%,使用地理距离阈值的朴素方法 F1 分数仅 75%。我们的训练与测试数据集均公开可用。

关键词

引用

@article{arxiv.2012.15267,
  title  = {Similarity Classification of Public Transit Stations},
  author = {Hannah Bast and Patrick Brosi and Markus Näther},
  journal= {arXiv preprint arXiv:2012.15267},
  year   = {2021}
}