基于大型基础模型的高性能车辆检测:VFM-Det
计算机视觉与模式识别
2024-08-26 v1 人工智能
神经与进化计算
摘要
现有的车辆检测器通常通过在车辆图像上训练典型检测器(如 YOLO、RCNN、DETR 系列)并基于预训练 backbone(如 ResNet、ViT)获得。一些研究者还利用并增强使用预训练的大型基础模型以提高检测性能。然而,我们认为这些检测器可能只能获得次优结果,因为所使用的大型模型并非专为车辆设计。此外,它们的结果严重依赖于视觉特征,很少考虑车辆语义信息与视觉表征之间的对齐。在本工作中,我们提出了一种基于预训练车辆基础模型 (VehicleMAE) 和大型语言模型 (T5) 的新型车辆检测范式,称为 VFM-Det。它遵循基于区域提议的检测框架,可通过 VehicleMAE 增强每个提议的特征。更重要的是,我们提出了新的 VAtt2Vec 模块,用于预测这些提议的车辆语义属性,并将其转换为特征向量以通过对比学习增强视觉特征。在三个车辆检测基准数据集上进行大量实验,充分证明了该车辆检测器的有效性。具体而言,在 Cityscapes 数据集上,我们的模型在 、 指标上分别提高了 、 。本工作的源代码将发布于 https://github.com/Event-AHU/VFM-Det。
关键词
引用
@article{arxiv.2408.13031,
title = {VFM-Det: Towards High-Performance Vehicle Detection via Large Foundation Models},
author = {Wentao Wu and Fanghua Hong and Xiao Wang and Chenglong Li and Jin Tang},
journal= {arXiv preprint arXiv:2408.13031},
year = {2024}
}
备注
In Peer Review