ExpressMind:面向公路运营的多模态预训练大语言模型
人工智能
2026-03-18 v1
摘要
当前公路运营依赖基于规则且孤立的模型,限制了其在不同系统之间进行联合知识分析的能力。同时,大语言模型(LLM)正在应用于智能交通领域,推动交通模型从算法智能向认知智能的演进。然而,通用LLM无法有效理解公路领域在非常规情景下的规章制度和事件因果关系。因此,本文构建了一个用于公路的预训练多模态大语言模型(MLLM),命名为ExpressMind,旨作为智能公路运营的认知核心。本文构建了行业首个全栈公路数据集,涵盖交通知识文本、应急推理链及标注视频事件,以弥补数据稀缺问题。本文提出一种基于自监督训练和无监督学习的双层LLM预训练范式。此外,本研究引入Graph-Augmented RAG框架,以动态索引公路知识库。为增强ExpressMind在应急事件响应策略推理方面的能力,我们开发了一种RL对齐的链式思维(RL-CoT)机制,以确保模型推理与专家问题解决 heuristics 一致。最后,ExpressMind集成了跨模态编码器,对齐视觉和文本通道下的动态特征序列,使其能够同时理解视频和图像模态中的交通场景。在我们新发布的多模态公路基准测试上进行的广泛实验表明,ExpressMind在事件检测、安全响应生成和复杂交通分析等任务上综合性地超越了现有的基线方法。代码和数据已公开:https://wanderhee.github.io/ExpressMind/。
引用
@article{arxiv.2603.16495,
title = {ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation},
author = {Zihe Wang and Yihuan Wang and Haiyang Yu. Zhiyong Cui and Xiaojian Liao and Chengcheng Wang and Yonglin Tian and Yongxin Tong},
journal= {arXiv preprint arXiv:2603.16495},
year = {2026}
}