中文

面向时空交通预测的Vision-LLM

机器学习 2026-05-15 v2

摘要

准确的时空交通预测是密集城市移动网络中主动资源管理的关键前提。虽然大型语言模型在时间序列分析方面显示出前景,但它们本质上难以建模基于网格的交通数据的复杂空间依赖关系。有效地将大型语言模型扩展到此领域具有挑战性,因为表示密集地理网格信息的方式效率低下,会压倒模型的上下文。为此,我们提出ST-Vision-LLM,一种将时空预测重新框定为视觉-语言融合问题的新型框架。我们的方法利用Vision-LLM视觉编码器处理历史全局交通矩阵作为图像序列,为模型提供全球视野以指导单元格级别的预测。为克服大型语言模型处理数值数据效率低下的问题,我们引入一种高效编码方案,将浮点值表示为单个词汇,通过专用词汇表,结合两阶段数值对齐微调过程。该模型首先进行监督式微调,然后使用基于组相对策略优化的强化学习方法进一步优化预测准确性。基于真实世界移动交通数据集的评估显示,ST-Vision-LLM在长期预测准确性方面优于现有方法15.6%,在跨域零样本场景中平均超过最佳基线约30%。我们的广泛实验验证了该模型在各种数据稀缺环境中的强大泛化能力。

关键词

引用

@article{arxiv.2510.11282,
  title  = {Vision-LLMs for Spatiotemporal Traffic Forecasting},
  author = {Ning Yang and Hengyu Zhong and Haijun Zhang and Randall Berry},
  journal= {arXiv preprint arXiv:2510.11282},
  year   = {2026}
}