对比学习驱动的交通标志感知:文本与视觉的多模态融合
计算机视觉与模式识别
2025-08-01 v1
摘要
交通标志识别作为自动驾驶感知系统的核心组件,直接影响车辆的环境感知能力与驾驶安全性。当前技术面临两大显著挑战:首先,交通标志数据集呈现明显的长尾分布,导致传统卷积网络在处理低频和分布外类别时识别性能大幅下降;其次,真实场景中的交通标志多为具有显著尺度变化的小目标,难以提取多尺度特征。为克服这些问题,我们提出了一种结合开放词汇检测与跨模态学习的新型两阶段框架。在交通标志检测阶段,我们的 NanoVerse YOLO 模型集成了可重参数化的视觉-语言路径聚合网络(RepVL-PAN)和 SPD-Conv 模块,专门增强对多尺度小目标的特征提取。在交通标志分类阶段,我们设计了交通标志识别多模态对比学习模型(TSR-MCL)。通过将 Vision Transformer 提取的视觉特征与基于规则的 BERT 提取的语义特征进行对比,TSR-MCL 学习到鲁棒且与频率无关的特征表示,有效缓解了由数据不平衡引起的类别混淆。在 TT100K 数据集上,我们的方法在全类别识别的长尾检测任务中达到了 78.4% mAP 的 SOTA 水平。该模型还获得了 91.8% 的准确率和 88.9% 的召回率,显著优于主流算法,展示了在复杂开放世界场景中卓越的准确性与泛化能力。
引用
@article{arxiv.2507.23331,
title = {Contrastive Learning-Driven Traffic Sign Perception: Multi-Modal Fusion of Text and Vision},
author = {Qiang Lu and Waikit Xiu and Xiying Li and Shenyu Hu and Shengbo Sun},
journal= {arXiv preprint arXiv:2507.23331},
year = {2025}
}
备注
11pages, 5 figures