中文

语义丰富的人类移动数据集:包含情境与社交维度

计算与语言 2026-01-14 v3 人工智能 社会与信息网络

摘要

本资源论文中,我们提供两个公开可用的人类轨迹数据集,数据集已进行语义丰富处理,并附带构建它们的 pipeline。轨迹数据来源于 OpenStreetMap 的公开 GPS 轨迹。每个数据集包括情境层,包括停靠点、行驶路径、地点 (POI)、推断出的交通方式以及天气数据。一个新颖的语义特征是包含由大型语言模型 (LLM) 生成的合成、逼真的社交媒体帖子,这使得多模态和语义的 mobility 分析成为可能。数据集以表格格式和 Resource Description Framework (RDF) 格式提供,支持语义推理和 FAIR 数据实践。它们覆盖两个结构上差异显著的大城市:巴黎和纽约。我们的开源可重复 pipeline 允许对数据集进行定制,而数据集支持行为建模、mobility 预测、知识图谱构建以及 LLM 应用等研究任务。我们认为这是首个将真实世界移动、结构化语义丰富、LLM 生成文本与语义网兼容性结合于可重复使用的框架。

关键词

引用

@article{arxiv.2510.02333,
  title  = {Human Mobility Datasets Enriched With Contextual and Social Dimensions},
  author = {Chiara Pugliese and Francesco Lettich and Guido Rocchietti and Chiara Renso and Fabio Pinelli},
  journal= {arXiv preprint arXiv:2510.02333},
  year   = {2026}
}

备注

5 pages, 3 figures, 1 table