中文

通过地址嵌入挖掘兴趣点:一种无监督方法

机器学习 2021-09-10 v1 信息检索

摘要

数字地图在全球范围内被广泛用于探索用户感兴趣的地方,通常被称为兴趣点。在在线外卖配送平台中,PoI 可以代表客户可以下单的任何主要私人建筑群,例如医院、住宅小区、办公大楼、教育机构和宿舍。在这项工作中,我们提出了一种端到端的无监督系统设计,用于从地址位置和地址文本中获取 PoI 的多边形表示。我们使用地名对地址文本进行预处理,并使用基于深度学习的架构(即在我们内部地址数据集上训练的 RoBERTa)生成地址文本的嵌入。通过联合聚类匿名化的客户手机 GPS 位置(在地址录入期间获得)和地址文本的嵌入来识别 PoI 候选者。使用新颖的后处理步骤从这些 PoI 候选者中获取最终的 PoI 多边形列表。与在我们的内部数据集上运行的 Mummidi-Krumm 基线算法相比,该算法识别出的 PoI 多了 74.8%。所提出的算法实现了 98% 的中位数面积精确率、8% 的中位数面积召回率和 0.15 的中位数 F1 分数。为了提高算法多边形的召回率,我们使用来自 OpenStreetMap (OSM) 数据库的建筑轮廓多边形对其进行后处理。后处理算法涉及使用来自 OSM 数据库的相交多边形和封闭的私人道路对算法多边形进行重塑,并考虑与 OSM 数据库中公共道路的交叉。我们在这些后处理多边形上实现了 70% 的中位数面积召回率、69% 的中位数面积精确率和 0.69 的中位数 F1 分数。

关键词

引用

@article{arxiv.2109.04467,
  title  = {Mining Points of Interest via Address Embeddings: An Unsupervised Approach},
  author = {Abhinav Ganesan and Anubhav Gupta and Jose Mathew},
  journal= {arXiv preprint arXiv:2109.04467},
  year   = {2021}
}

备注

18 pages, single column