CLIP-SENet:用于车辆重识别的基于 CLIP 的语义增强网络
计算机视觉与模式识别
2025-02-25 v1
摘要
车辆重识别(Re-ID)是智能交通系统(ITS)中的一项关键任务,旨在跨不同监控摄像头检索并匹配同一车辆。大量研究探索了通过语义增强来提升车辆 Re-ID 的方法。然而,这些方法通常依赖额外的标注信息使模型能够提取有效的语义特征,这带来了诸多限制。本工作提出了一种基于 CLIP 的语义增强网络(CLIP-SENet),这是一个旨在自主提取并细化车辆语义属性的端到端框架,有助于生成更鲁棒的语义特征表示。受大规模视觉-语言模型为下游任务提供的零样本解决方案启发,我们利用 CLIP 图像编码器强大的跨模态描述能力初步提取通用语义信息。我们未使用文本编码器进行语义对齐,而是设计了自适应细粒度增强模块(AFEM),在细粒度级别自适应地增强该通用语义信息,以获得鲁棒的语义特征表示。随后将这些特征与常见的 Re-ID 外观特征融合,以进一步细化车辆间的区分度。我们在三个基准数据集上的综合评估证明了 CLIP-SENet 的有效性。本方法实现了新的 SOTA 性能,在 VeRi-776 数据集上达到 92.9% mAP 和 98.7% Rank-1,在 VehicleID 数据集上达到 90.4% Rank-1 和 98.7% Rank-5,在更具挑战性的 VeRi-Wild 数据集上达到 89.1% mAP 和 97.9% Rank-1。
引用
@article{arxiv.2502.16815,
title = {CLIP-SENet: CLIP-based Semantic Enhancement Network for Vehicle Re-identification},
author = {Liping Lu and Zihao Fu and Duanfeng Chu and Wei Wang and Bingrong Xu},
journal= {arXiv preprint arXiv:2502.16815},
year = {2025}
}