中文

用于车辆中心感知的结构信息引导多模态预训练

计算机视觉与模式识别 2023-12-18 v1 人工智能

摘要

理解图像中的车辆对于智能交通和自动驾驶系统等各种应用至关重要。现有的以车辆为中心的研究通常在大规模分类数据集上预训练模型,然后针对特定的下游任务进行微调。然而,它们忽略了不同任务中车辆感知的具体特性,可能导致次优性能。为解决这一问题,我们提出了一种名为 VehicleMAE 的新型以车辆为中心的预训练框架,该框架结合了结构信息,包括来自车辆轮廓信息的空间结构和来自信息丰富的高层自然语言描述的语义结构,以实现有效的掩蔽车辆外观重建。具体而言,我们显式提取车辆的草图线条作为空间结构的一种形式,以指导车辆重建。基于成对/非成对车辆图文样本的相似性,从 CLIP 大模型中蒸馏出的更全面知识被进一步纳入考虑,以帮助实现对车辆的更好理解。我们构建了一个大规模数据集来预训练我们的模型,命名为 Autobot1M,其中包含约 100 万张车辆图像和 12693 条文本信息。在四个基于车辆的下游任务上的大量实验充分验证了我们 VehicleMAE 的有效性。源代码和预训练模型将发布于 https://github.com/Event-AHU/VehicleMAE。

关键词

引用

@article{arxiv.2312.09812,
  title  = {Structural Information Guided Multimodal Pre-training for Vehicle-centric Perception},
  author = {Xiao Wang and Wentao Wu and Chenglong Li and Zhicheng Zhao and Zhe Chen and Yukai Shi and Jin Tang},
  journal= {arXiv preprint arXiv:2312.09812},
  year   = {2023}
}

备注

Accepted by AAAI-2024