中文

基于人口普查与土地利用数据的大型语言模型生成个体旅行日记

计算与语言 2025-10-22 v2 人工智能 机器学习

摘要

本研究引入一种大型语言模型(LLM)方案,用于生成代理基运输模型中的个体旅行日记。传统方法依赖大量专有数据中的家庭旅行调查,而本研究方法通过直接提示(direct prompting)方式,从开源的美国人口普查局(American Community Survey, ACS)和智能地点数据库(Smart Location Database, SLD)数据中随机生成角色,再综合日记。本研究提出一种新型的“一对-群体”现实性评分(one-to-cohort realism score):由四个指标组成(行程计数得分、区间得分、目的得分和模式得分),并通过对照康涅狄格州全州交通研究(Connecticut Statewide Transportation Study, CSTS)日记进行验证,按人口统计变量进行匹配。验证采用 Jensen-Shannon 散度(Jensen-Shannon Divergence)衡量生成日记与真实日记之间的分布相似性。与使用经典方法(行程生成采用负二项分布;模式/目的采用多项逻辑律)在验证集上校准生成的日记相比,LLM 生成的日记在整体现实性方面表现相当(LLM 平均值:0.485 vs. 0.455)。LLM 在确定行程目的方面表现突出,并展现出更好的一致性(更窄的现实性评分分布),而经典模型在行程计数和活动持续时间的数值估计方面更具优势。总体验证确认 LLM 的统计代表性(LLM 平均值:0.612 vs. 0.435),证明了 LLM 的零样本可行性,并为未来合成日记评估系统建立了可量化的现实性指标。

关键词

引用

@article{arxiv.2509.09710,
  title  = {Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data},
  author = {Sepehr Golrokh Amin and Devin Rhoads and Fatemeh Fakhrmoosavi and Nicholas E. Lownes and John N. Ivan},
  journal= {arXiv preprint arXiv:2509.09710},
  year   = {2025}
}