语义丰富的人类移动数据集:包含情境与社交维度
计算与语言
2026-01-14 v3 人工智能
社会与信息网络
摘要
本资源论文中,我们提供两个公开可用的人类轨迹数据集,数据集已进行语义丰富处理,并附带构建它们的 pipeline。轨迹数据来源于 OpenStreetMap 的公开 GPS 轨迹。每个数据集包括情境层,包括停靠点、行驶路径、地点 (POI)、推断出的交通方式以及天气数据。一个新颖的语义特征是包含由大型语言模型 (LLM) 生成的合成、逼真的社交媒体帖子,这使得多模态和语义的 mobility 分析成为可能。数据集以表格格式和 Resource Description Framework (RDF) 格式提供,支持语义推理和 FAIR 数据实践。它们覆盖两个结构上差异显著的大城市:巴黎和纽约。我们的开源可重复 pipeline 允许对数据集进行定制,而数据集支持行为建模、mobility 预测、知识图谱构建以及 LLM 应用等研究任务。我们认为这是首个将真实世界移动、结构化语义丰富、LLM 生成文本与语义网兼容性结合于可重复使用的框架。
引用
@article{arxiv.2510.02333,
title = {Human Mobility Datasets Enriched With Contextual and Social Dimensions},
author = {Chiara Pugliese and Francesco Lettich and Guido Rocchietti and Chiara Renso and Fabio Pinelli},
journal= {arXiv preprint arXiv:2510.02333},
year = {2026}
}
备注
5 pages, 3 figures, 1 table