中文

面向车辆的感知通过多模态结构化预训练

计算机视觉与模式识别 2025-12-24 v1 人工智能 机器学习

摘要

车辆中心感知在许多智能系统中发挥着关键作用,包括大规模监控系统、智能交通和自动驾驶。现有方法在预训练期缺乏有效的车辆相关知识学习能力,导致对建模通用车辆感知表征的能力较差。为处理此问题,我们提出了 VehicleMAE-V2,这是一个面向车辆的预训练大模型。通过探索和利用车辆相关的多模态结构化先验条件以指导掩码标记重建过程,我们的方法可以显著增强模型学习车辆中心感知通用表征的能力。具体而言,我们设计了对称引导的掩码模块(SMM)、轮廓引导的表示模块(CRM)和语义引导的表示模块(SRM),以将车辆的对称性、轮廓和语义等三类结构化先验纳入标记重建中。SMM 利用车辆对称性约束以避免保留对称性掩码块,从而选择高质量的掩码图像块并减少信息冗余。CRM 通过最小化轮廓特征与重建特征之间的概率分布发散,从而在像素级重建期间保留整体车辆结构信息。SRM 通过对比学习和跨模态蒸馏来对齐图像-文本特征,以解决掩码重建期间因语义理解不足而导致的特征混淆问题。为支持 VehicleMAE-V2 的预训练,我们构建了 Autobot4M 数据集,包含约400万张车辆图像和12693条文本描述。在五个下游任务上的大量实验表明,VehicleMAE-V2 的性能卓越。

关键词

引用

@article{arxiv.2512.19934,
  title  = {Vehicle-centric Perception via Multimodal Structured Pre-training},
  author = {Wentao Wu and Xiao Wang and Chenglong Li and Jin Tang and Bin Luo},
  journal= {arXiv preprint arXiv:2512.19934},
  year   = {2025}
}

备注

Journal extension of VehicleMAE (AAAI 2024)