中文

基于多模态视觉语言和运动分析的序数标度交通拥堵分类

计算机视觉与模式识别 2025-10-14 v1

摘要

精准的交通拥堵分类是智能交通系统和实时城市交通管理的关键。本文提出了一种多模态框架,结合开放词汇视觉语言推理(CLIP)、目标检测(YOLO-World)和基于MOG2的背景减除运动分析。该系统对交通拥堵程度进行序数尺度预测(从1表示畅通到5表示严重拥堵),实现语义对齐和时序一致的分类。为提升可解释性,我们引入基于运动的置信度加权并生成带注释的视觉输出。实验结果表明,该模型达到76.7%的准确率,F1分数为0.752,四分位数加权Kappa(QWK)为0.684,显著优于单模态基线。这些结果表明,该框架在保持序数结构方面有效,能够利用视觉语言和运动模态。未来工作包括引入车辆尺寸和更精细的密度指标。

关键词

引用

@article{arxiv.2510.10342,
  title  = {Ordinal Scale Traffic Congestion Classification with Multi-Modal Vision-Language and Motion Analysis},
  author = {Yu-Hsuan Lin},
  journal= {arXiv preprint arXiv:2510.10342},
  year   = {2025}
}

备注

7 pages, 4 figures. Preprint submitted to arXiv in October 2025