中文

面向安全出行:基于开放式视觉语言数据集的统一交通基础模型

计算机视觉与模式识别 2026-04-27 v1 人工智能

摘要

城市交通系统面临日益增长的安全挑战,需要可扩展的智能以应对新兴的智能出行基础设施。尽管近期的基础模型和大规模多模态数据集的进展加强了智能交通系统(ITS)中的感知与推理能力,但现有研究仍主要聚焦于微观级自动驾驶(AD),对城市尺度的交通分析关注有限。特别是,针对开放式安全导向视觉问答(VQA)及其对应基础模型,针对异构路侧摄像头观察进行推理,仍鲜有探索。为填补这一空白,我们引入 Land Transportation Dataset(LTD),一个用于城市交通环境中开放式推理的大规模开放源码视觉语言数据集。LTD 包含 11.6K 组高质量 VQA 对,来自异构路侧摄像头,涵盖多样化的道路几何、交通参与者、照明条件以及恶劣天气。该数据集集成三种互补任务:细粒度多目标定位、多图像摄像机选择以及多图像风险分析,要求对最小相关性视图进行联合推理,以推断危险对象、贡献因素以及危险路段。为确保标注忠实性,我们采用多模型视觉语言生成结合交叉验证和人类在环精炼相结合。基于 LTD,我们进一步提出 UniVLT,一种通过基于课程的知识迁移训练以统一微观 AD 推理与宏观交通分析的单一架构。在 LTD 及多个 AD 基准上的大量实验表明,UniVLT 在跨域多样化任务上的开放式推理性能实现 SOTA,同时暴露了现有基础模型在复杂多视图交通情景中的局限性。

关键词

引用

@article{arxiv.2604.22260,
  title  = {Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset},
  author = {Wenhui Huang and Songyan Zhang and Collister Chua and Yang Liang and Zhiqi Mao and Heng Yang and Chen Lv},
  journal= {arXiv preprint arXiv:2604.22260},
  year   = {2026}
}