中文

CLIPVehicle:面向视觉车辆检索的统一框架

计算机视觉与模式识别 2025-08-07 v1

摘要

车辆作为现实世界中最常见且最重要的对象,其计算机视觉技术研究取得了显著进展,如车辆检测、车辆重识别等。现有方法首先预检测并存储所有车辆 patch,然后应用车辆重识别模型,这在资源上较为昂贵且不够实用。在本工作中,我们旨在实现车辆检索的联合检测与重识别。然而,聚焦于共享车辆常见性的检测目标与聚焦于 individual vehicle uniqueness 的重识别目标之间的冲突,使得模型在 end-to-end 系统中学习变得具有挑战性。为解决此问题,我们提出一种新的统一框架,即 CLIPVehicle,包含 dual-granularity semantic-region alignment 模块,用于利用 VLMs (视觉语言模型) 进行车辆判别建模,以及 multi-level vehicle identification learning 策略,从 global、instance 和 feature 三个层次学习身份表示。我们还构建了一个新的基准,包括真实世界数据集 CityFlowVS 以及两个合成数据集 SynVS-Day 和 SynVS-All,用于车辆检索。广泛的实验结果表明,我们的方法在车辆 Re-ID 和人员搜索任务中均优于最先进的方法。

关键词

引用

@article{arxiv.2508.04120,
  title  = {CLIPVehicle: A Unified Framework for Vision-based Vehicle Search},
  author = {Likai Wang and Ruize Han and Xiangqun Zhang and Wei Feng},
  journal= {arXiv preprint arXiv:2508.04120},
  year   = {2025}
}