中文

重新审视合成人类轨迹:超越Datasaurus的仿照生成与基准

机器学习 2025-05-20 v2 人工智能

摘要

人类轨迹数据在众多应用中起着关键作用,如人群管理和流行病防控,但由于实际限制和隐私顾虑,获取此类数据具有挑战性。因此,人们倾向于生成合成人类轨迹数据,以尽可能贴近真实世界的人类轨迹,往往基于统计摘要和分布相似性。然而,这些相似性简化了复杂的人类 mobility 模式(即“Datasaurus”),导致在生成模型设计和生成轨迹基准测试中存在内在偏差。针对这一背景,我们提出MIRAGE(huMan-Imitative tRAjectory GenErative model),一种神经时态点过程模型,集成探索与优先返回模型,旨在仿照人类决策过程生成轨迹,而非像传统方法那样拟合特定统计分布,从而避免Datasaurus问题。我们还提出了一种基于任务的全面评估协议,超越Datasaurus,对四个典型下游任务进行系统性基准测试,集成多种技术和评估指标,以评估生成轨迹的最终实用性。我们在三个真实世界用户轨迹数据集上对MIRAGE进行了详尽评估,同时对照大量基线方法。结果表明,与最佳基线方法相比,MIRAGE生成的轨迹数据不仅在统计和分布相似性方面提升了59.0%-67.7%,还在基于任务的评估中实现了10.9%-33.4%的提升。一系列消融研究也验证了MIRAGE的关键设计选择。

关键词

引用

@article{arxiv.2409.13790,
  title  = {Revisiting Synthetic Human Trajectories: Imitative Generation and Benchmarks Beyond Datasaurus},
  author = {Bangchao Deng and Xin Jing and Tianyue Yang and Bingqing Qu and Dingqi Yang and Philippe Cudre-Mauroux},
  journal= {arXiv preprint arXiv:2409.13790},
  year   = {2025}
}

备注

Accepted by KDD'25