通过高效分层位置表示在个人轨迹中预训练上下文位置嵌入
人工智能
2023-10-03 v1 机器学习
摘要
从人类移动数据生成的位置嵌入的预训练已成为基于位置服务的流行方法。实践中,由于精细分辨率或广阔目标区域下需训练的位置数量庞大,位置嵌入建模代价过高。以往研究处理少于一万个不同位置,难以满足真实应用需求。为解决此问题,我们提出Geo-Tokenizer,通过将位置表示为不同尺度下若干网格的组合,高效减少待训练位置数。在Geo-Tokenizer中,较大尺度网格共享较小尺度网格的公共集合,这是缩减位置词表规模的关键。经Geo-Tokenizer预处理的位置序列由因果位置嵌入模型利用,以捕捉位置的时间依赖关系。该模型动态计算目标位置的嵌入向量,随其轨迹变化。此外,为高效预训练位置嵌入模型,我们提出分层自回归位置模型目标,以有效训练Geo-Tokenizer中分解的位置。我们在两个真实世界用户轨迹数据集上使用预训练位置模型进行实验。实验结果表明,与现有位置嵌入方法相比,我们的模型以更少的模型参数显著提升了下游任务性能。
引用
@article{arxiv.2310.01252,
title = {Pre-training Contextual Location Embeddings in Personal Trajectories via Efficient Hierarchical Location Representations},
author = {Chung Park and Taesan Kim and Junui Hong and Minsung Choi and Jaegul Choo},
journal= {arXiv preprint arXiv:2310.01252},
year = {2023}
}
备注
Accepted at European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD) 2023